Vad är tokenization – och varför räknar AI ord så konstigt?

Du kanske har märkt att AI-verktyg ibland räknar ord på ett märkligt sätt. När du kopierar in en text får du höra att den är 847 ”tokens”, inte ord. Eller att du har 8 000 tokens kvar i ditt kontextfönster. Vad betyder det egentligen – och varför kan inte AI bara räkna ord som vanligt folk?

Tokenization är processen där AI delar upp text i små bitar som den kan förstå och jobba med. Dessa bitar kallas tokens, och de är språkmodellernas sätt att läsa. Precis som vi människor läser bokstäver och ord, läser AI tokens. Men en token är varken riktigt en bokstav eller ett helt ord – det är något mittemellan.

Ett vanligt svenskt ord som ”katt” blir vanligtvis en token. Men ”kattungar” kan bli två: ”katt” och ”ungar”. Ordet ”AI” är ofta en enda token, medan ”artificiell intelligens” blir flera. Engelska ord tenderar att bli färre tokens än svenska, eftersom de flesta AI-modeller tränats mest på engelska text.

Varför gör AI på det här konstiga sättet? Tänk dig att du ska lära dig ett nytt språk med miljontals ord. Det skulle ta evigheter att memorera varenda ordet separat. Istället lär du dig orddelar och mönster – ”ung” betyder något litet, ”-are” gör ord till jämförelser, och så vidare. På liknande sätt delar AI upp språket i återkommande bitar som är effektiva att jobba med.

En token kan vara ett helt vanligt ord, en bit av ett ord, ett skiljetecken eller till och med ett mellanslag. Siffror behandlas ofta annorlunda – ”2024” kan bli flera tokens, vilket är en anledning till att AI ibland är sämre på matematik. Varje emoji är också sin egen token, vilket förklarar varför en mening full med emojis ”kostar” mer än en vanlig mening.

Det här spelar roll i praktiken på flera sätt. När ett verktyg säger att du har plats för 4 000 tokens betyder det ungefär 3 000 svenska ord, men det varierar. Längre ord och specialtermer tar mer plats. Om du skriver på svenska och byter till engelska kan plötsligt samma innehåll ta mindre utrymme.

Många AI-tjänster prissätter efter antal tokens, inte ord. Om du betalar per användning är det alltså tokens som räknas. Det betyder att en kort, kärnfull prompt ofta är billigare än en utsvävande, även om skillnaden i ord inte är så stor. Tokens förklarar också varför vissa tecken och språk kostar mer – arabiska eller kinesiska tecken kan kräva fler tokens per ord än latinska bokstäver.

När AI säger att den ”kan hantera 128 000 tokens” pratar den om sin arbetsminneskapacitet. Det är summan av både det du skriver in och det AI:n svarar. En lång konversation förbrukar tokens i båda riktningarna. Det är därför en chattråd ibland börjar ”glömma” tidiga delar – när token-utrymmet tar slut tvingas AI:n släppa det äldsta för att få plats med det nya.

Du behöver inte räkna tokens manuellt i vardagen. Men när du förstår grundprincipen förstår du också varför AI ibland verkar ”tappa tråden”, varför vissa texter kostar mer att bearbeta, och varför kortare och tydligare språk ofta ger bättre resultat. Tokens är helt enkelt AI:ns sätt att läsa – och när du vet det kan du använda verktygen lite smartare.