Kunstig Intelligens

Lynrask oppstart av AI-modeller: Ny teknologi kutter ventetiden for GPU-er

Infrastrukturselskapet Cerebrium har lansert en ny teknologisk løsning som angriper et av de mest kostbare problemene ved drift av avanserte AI-modeller: "kalde starter" (cold starts). Ved å ta i bruk minnesnapshotting i virtualiseringsteknologien GVisor, har de demonstrert at tunge CUDA- og GPU-arbeidsoppgaver kan vekkes og gjenopprettes på under ett sekund.

For å forstå hvorfor dette er et etterlengtet gjennombrudd, må vi se på hvordan AI-infrastruktur fungerer i dag. Når man kjører AI-modeller i skyen på forespørsel (såkalt serverless), skrus serverne av når de ikke er i bruk for å spare penger. Men i det øyeblikket en bruker sender en ny forespørsel, må systemet starte opp GPU-en og laste gigantiske AI-modeller inn i minnet fra bunnen av. Denne oppstartsprosessen har hittil tatt alt fra mange sekunder til flere minutter, noe som skaper en uakseptabel ventetid for brukerne.

For selskaper som leverer sanntidstjenester – som AI-støttede kundesentre, umiddelbar bildegenerering eller dynamiske analyseverktøy – fjerner denne teknologien et kritisk kompromiss. Man slipper nå å velge mellom skyhøye regninger for å holde GPU-er konstant kjørende ("varme"), eller å straffe kundene med treg responstid. Systemene kan trygt skaleres helt ned til null i rolige perioder, vel vitende om at de våkner på et blunk når pågangen øker.

Dette gir helt nye rammebetingelser for finansdirektører i selskaper med svingende AI-etterspørsel. Ved å betale utelukkende for de faktiske sekundene modellen prosesserer data, fremfor å kaste bort penger på ubrukt kapasitet, blir driftskostnadene betydelig mer forutsigbare. Det gjør det også langt mer lønnsomt å rulle ut spesialiserte, mindre AI-modeller til snevre forretningsoppgaver som kun brukes sporadisk gjennom arbeidsdagen. Les mer hos Cerebrium.