Kunstig Intelligens

Nytt perspektiv på sikkerhetsstyring av KI-modeller

Forskere foreslår en utradisjonell tilnærming til AI-alignment (metoder for å sikre at KI-systemer handler i tråd med menneskelige intensjoner). I stedet for å definere stadig strengere begrensninger, tar forslaget utgangspunkt i såkalt specification gaming (når en KI-modell finner uforutsette smutthull i reglene den har fått for å nå et mål). Ved å systematisk kartlegge og analysere hvordan modeller omgår intensjoner, ønsker man å bygge mer robuste sikkerhetsmekanismer for komplekse systemer.

[Kilde: Hacker News]