23. June 2026
Selskapet Modal har lansert en ny løsning kalt «Auto Endpoints», som automatisk optimaliserer kjøringen av AI-modeller (såkalt inferens) på infrastruktur du selv kontrollerer. Målet er å gjøre det langt enklere og mer kostnadseffektivt for bedrifter å drifte sine egne, skreddersydde AI-modeller uten å kaste bort penger på ubrukt serverkapasitet.
Bakgrunnen er en velkjent hodepine for teknologiledere: Å kjøre spesialtilpassede språkmodeller eller bildegeneratorer krever enormt med GPU-kraft (skjermkort). Fram til nå har man ofte måttet velge mellom to onder: Enten låse seg til dyre, eksterne API-tjenester hvor man betaler per forespørsel, eller bruke verdifulle ingeniørtimer på å bygge og vedlikeholde egne serveroppsett som ofte blir stående ubrukt og tikke kostnader når pågangen er lav.
For selskaper som utvikler egne programvaretjenester (SaaS) betyr denne teknologien at man kan kutte mellomleddene. Ved at systemet automatisk skalerer serverkapasiteten opp og ned i takt med den faktiske trafikken, faller driftskostnadene dramatisk. Det gjør det plutselig økonomisk forsvarlig å tilby skreddersydde, lokale AI-modeller til mindre kundegrupper, samtidig som sensitiv kundedata aldri forlater bedriftens egne skyområder. Finansdirektøren får mer forutsigbare IT-budsjetter, mens utviklingsteamet slipper å bruke helgene på å finjustere serverkapasitet.
Du kan lese mer om detaljene rundt arkitekturen hos Modal.