Kunstig Intelligens

Vannmerking av tekst kan svekke sikkerheten til språkmodeller

Implementering av vannmerkingsteknologi for tekst, som Googles SynthID (en metode for å legge inn usynlige sporingsmønstre i KI-generert tekst), kan uventet gjøre store språkmodeller mer sårbare for manipulasjon. Sikkerhetstester viser at vannmerkingsmekanismer kan påvirke modellene til å utføre skadelige instruksjoner (såkalte adversarial prompts) som de under normale omstendigheter ville ha avvist. Dette skaper en ny utfordring der forsøk på å sikre sporbarhet og opphav i KI-generert innhold i stedet kan åpne nye sikkerhetshull i systemene.

[Kilde: Ars Technica]