Kunstig Intelligens

Evaluering av 10 AI-modeller på komplekse 3D-oppgaver i nettleseren

En fersk benchmarking-test har evaluert ti ulike kombinasjoner av store språkmodeller og testrammeverk (såkalte "harnesses", som brukes til å automatisere, kjøre og måle AI-ytelse) på den samme utvikleroppgaven i Three.js – et JavaScript-bibliotek som brukes til å lage 3D-grafikk i nettleseren. Testen gir en indikasjon på hvordan AI-verktøy håndterer visuelle og romlige kodeutfordringer, i motsetning til mer tradisjonelle, tekstbaserte programmeringsoppgaver. Resultatene belyser hvilke oppsett som faktisk fungerer når AI skal settes til å generere mer avansert frontend-kode. [Kilde: Hacker News]