07. September 2026
Det populære open-source-rammeverket vLLM, som brukes til å kjøre og servere store språkmodeller (LLMs) effektivt, har nå fått støtte for spekulativ dekoding på AMD-grafikkort. Spekulativ dekoding er en optimaliseringsteknikk der en mindre og raskere modell gjør kvalifiserte gjetninger på de neste ordene i en tekst, før den store hovedmodellen verifiserer gjetningene i parallell. Dette kutter ventetiden og øker hastigheten på tekstgenerering betydelig uten tap av presisjon. Utviklingen gjør AMDs maskinvare til et mer konkurransedyktig alternativ til Nvidias brikker for bedrifter som drifter egne modeller.
[Kilde: Hacker News]