13. June 2026
Det har lenge vært en etablert sannhet at hvis du skal kjøre de virkelig skarpe språkmodellene selv, må du enten punge ut for rådyre bedriftsservere eller godta sneglefart på kontor-PC-en. Nå viser ferske tester at denne barrieren er i ferd med å pulveriseres. Ved å kombinere Nvidias RTX 5080 med den eldre traveren RTX 3090, har teknologer klart å kjøre den svært kapable åpne modellen Qwen 3.6 (en modell med 27 milliarder parametere) i en vanvittig fart på over 80 ord/tegn per sekund. Det er langt raskere enn de fleste av oss klarer å lese, og fjerner den irriterende ventetiden vi ofte forbinder med lokal AI.
Bakgrunnen for dette spranget handler om optimalisering av åpen kildekode og smart gjenbruk av maskinvare. Tidligere krevde det dyp teknisk innsikt og helt identiske, kostbare skjermkort for å oppnå lignende resultater. Nå gjør moderne programvare det mulig å "sy sammen" ulike generasjoner grafikkort som bedriften kanskje allerede har liggende, eller som kan kjøpes relativt rimelig i vanlig elektronikkbutikk. Modellen som kjøres er i en tilnærmet tapsfri, komprimert versjon, noe som betyr at du får nær maksimal hjernekraft uten behov for en superdatamaskin.
For virksomheter som håndterer sensitive personopplysninger, klientmidler eller uoffentliggjorte finansdata, fjerner dette et enormt dilemma. I stedet for å sende sensitive data ut av huset til amerikanske skytjenester, kan dere nå drifte en lynrask, intern AI-assistent på et lukket, lokalt system. Dataene forlater aldri bygningen, og sikkerhetsavdelingen kan sove godt om natten.
For IT-avdelinger som prøver å tøyle galopperende skykostnader og uforutsigbare API-lisenser, gir dette en helt ny handlingsfrihet. Engangsinvesteringen i et par standard skjermkort er tjent inn på oppsiktsvekkende kort tid dersom bedriften har ansatte som gjør tusenvis av AI-søk og tekstanalyser hver eneste dag. Driftskostnaden per spørring reduseres i praksis til prisen av litt strøm.