Kunstig Intelligens

Sårbarhet i praksis: Dette skjer når 2000 hackere angriper AI-assistenten din

En uavhengig utvikler inviterte nylig over 2000 unike brukere til en offentlig stresstest av en AI-assistent drevet av Claude-modellen. Målet for de "vennligsinnede hackerne" var enkelt: Å manipulere språkmodellen til å bryte sine egne sikkerhetsregler og avsløre skjult informasjon. Resultatene gir en solid dose realitetsorientering for beslutningstakere som planlegger å sette AI-agenter i direkte kontakt med kunder.

Mange selskaper skynder seg i dag med å rulle ut chat-assistenter for å effektivisere kundeservice eller automatisere enkle brukeroppgaver. Disse systemene styres ofte av såkalte "systemprompter" – usynlige instruksjoner som forteller AI-en hvordan den skal oppføre seg, og hva den ikke har lov til å gjøre. Utfordringen er at store språkmodeller behandler disse instruksjonene og brukerens fritekst-meldinger i samme "gryte". Dette åpner for såkalt prompt injection, der kreative brukere klarer å lure systemet til å overstyre de bakenforliggende reglene.

For selskaper som ruller ut kundevendt chatbot-teknologi eller AI-styrte salgsagenter, viser eksperimentet at systemprompter alene fungerer dårlig som eneste forsvarslinje. Hvis en angriper klarer å manipulere chatboten til å gi uautoriserte rabatter, godkjenne feilaktige returer eller lekke interne prisstrategier, hjelper det lite at "instruksjonen sa at den ikke skulle gjøre det". Sikkerhet kan ikke basere seg på en antakelse om at AI-en er smart nok til å motstå manipulasjon i en ren tekstsamtale.

Sikkerhetsansvarlige og systemarkitekter bør derfor bygge forsvar i flere lag rundt teknologien. Dette innebærer blant annet å bruke uavhengige, regelbaserte filtre som skanner både innkommende meldinger og AI-ens svar før de når sluttbrukeren. I tillegg bør AI-agenter aldri gis direkte fullmakt til å utføre kritiske handlinger – som å overføre penger eller endre sensitive databaser – uten at en menneskelig ansatt fungerer som en siste godkjenningsinstans.

Du kan lese hele analysen av angrepene og de tekniske forsvarsmekanismene på fernandoi.cl.