Kunstig Intelligens

Slik overvåkes AI-agentene: Armature sporer «tankerekken» bak MCP-kall

Å gi autonome AI-agenter tilgang til bedriftens verktøy og databaser er i ferd med å bli langt enklere takket være Model Context Protocol (MCP) – en åpen standard utviklet av Anthropic for sikker kommunikasjon mellom AI-modeller og eksterne verktøy. Utfordringen har imidlertid vært mangelen på innsikt; når en agent feiler, er det vanskelig å vite om det skyldtes en feiltolking av brukerens forespørsel, eller om det var selve verktøykallingen som feilet. Det nystartede selskapet Armature løser dette ved å tilby produktanalyse og evalueringer skreddersydd for nettopp MCP-sesjoner.

Tjenesten rekonstruerer hele samtalen og agentens interne «tankerekke» (såkalt chain-of-thought, der modellen forklarer sine egne steg før den utfører dem) parallelt med verktøykallene den utfører. Ved å integrere dette verktøyet med tre linjer kode, får utviklere og systemansvarlige umiddelbar oversikt over hva brukeren faktisk ba om, og hvorfor agenten valgte å utføre de spesifikke handlingene den gjorde. Dette fyller et kritisk tomrom i produksjonssetting av agenter, hvor feilsøking av uforutsigbar oppførsel hittil har vært en manuell og tidkrevende prosess.

Hvor store kodeprosjekter kan kunstig intelligens faktisk håndtere alene?

Forskningsgruppen Epoch AI har lansert MirrorCode, et nytt evalueringsrammeverk designet for å teste grensene for hva AI-agenter kan utrette av autonom programvareutvikling på egen hånd. I stedet for enkle og isolerte kodeoppgaver måler dette verktøyet agentenes evne til å navigere, forstå og endre store, eksisterende kodebaser uten menneskelig innblanding. Resultatene understreker gapet mellom å skrive enkeltfunksjoner og det å faktisk vedlikeholde kompleks produksjonskode, og gir bedrifter et realistisk nullpunkt for når det er forsvarlig å overlate større refaktorerings- og migreringsjobber til autonome agenter.

Den ultimate automatisering: Kontinuerlig integrasjon styrt av en LLM-instruksjon

Utvikleren David Crawshaw har demonstrert et minimalistisk, men fascinerende konsept for ekstrem automatisering: En nattlig tidsstyrt jobb (cron-jobb) som sender en instruksjon (prompt) til en språkmodell om å hente de siste endringene fra hovedgrenen til et programvareprosjekt, flette inn lokale endringer, kjøre automatiske tester for å verifisere at alt fungerer som tiltenkt, og deretter rulle ut den nye versjonen i produksjon. Dette representerer en variant av kontinuerlig integrasjon (CI) der språkmodellen ikke bare foreslår kode, men fungerer som en autonom driftsingeniør som tar beslutninger om produksjonssetting basert på testresultater.

Internasjonale Trender

USAs kongress omfavner ChatGPT tross sikkerhetsadvarsler

Regnskapstall fra Representantenes hus i USA viser at OpenAI dominerer AI-forbruket på Capitol Hill i form av betalte ChatGPT-lisenser. Til tross for strenge retningslinjer og tidvis skepsis mot datasikkerhet i offentlig sektor, bruker politiske kontorer verktøyet aktivt til å skrive utkast til notater, oppsummere tunge lovforslag og formulere svar på henvendelser fra innbyggere. Dette er et tydelig eksempel på at pragmatisk nytteverdi ofte trumfer teoretiske sikkerhetsbekymringer i kunnskapsintensive organisasjoner, og at behovet for effektivisering tvinger frem adopsjon selv på tradisjonsbundne arbeidsplasser.

Andre Nyheter