03. August 2026
OpenAI har offentliggjort de tekniske detaljene bak utviklingen av GPT-Live, en arkitektur utviklet over seks måneder for å muliggjøre kontinuerlig stemmeinteraksjon i sanntid. Der tidligere stemmetjenester har vært avhengige av en hakkete sekvens – hvor brukeren snakker, lyden transkriberes til tekst, tolkes av en språkmodell, og til slutt genereres som kunstig tale – introduserer GPT-Live en såkalt "turnless" (tur-løs) talemodell. Dette gjør at maskinen lytter og snakker parallelt, og kan håndtere avbrytelser, nøling og endringer i toneleie umiddelbart.
For å oppnå den ekstremt lave forsinkelsen (latency) som kreves for at en samtale skal føles naturlig, har OpenAI kuttet ut de tradisjonelle mellomleddene. I stedet bruker de en helhetlig multimodal modell – en AI-modell som kan forstå og prosessere flere datatyper samtidig – for å behandle lyd direkte inn og direkte ut. Den største tekniske utfordringen har ligget i å trene modellen til å skille mellom faktiske avbrytelser fra brukeren og ren bakgrunnsstøy, samt å strømme lyddata stabilt over varierende nettverksforbindelser uten opphold i lyden.
Dette skiftet endrer premissene for automatisk kundedialog og telefonsupport. AI-agenter – programvareløsninger som utfører oppgaver selvstendig basert på instrukser – blir med dette i stand til å håndtere komplekse og uforutsigbare samtaler uten den frustrerende tidsforsinkelsen som tidligere avslørte maskinen. For virksomheter betyr dette at verktøy for sanntidsdialog nå er modne nok til å integreres direkte i kritiske kundegrensesnitt.