15. August 2026
Ved tagging av store mengder innhold kan begrensninger i modellens kontekstvindu – altså hvor mye informasjon den kan prosessere på én gang – gjøre tradisjonell klassifisering utfordrende dersom listen over eksisterende kategorier er for lang. Utvikleren Simon Willison foreslår en pragmatisk metode der man i stedet ber en LLM (stor språkmodell) generere fritt tilpassede emneknagger for teksten uten restriksjoner. Ved å la modellen foreslå merkelapper fritt i stedet for å tvinge den til å velge fra en liste med tusenvis av alternativer, kan man i ettertid bruke enklere metoder for å koble de genererte ordene opp mot den eksisterende taksonomien.
[Kilde: Simon Willison]