Tokens sind die Einheiten, in die ein LLM Text zerlegt — meist Wortbestandteile; Faustregel Deutsch/Englisch: ein Token ≈ ¾ Wort.
Was bedeutet Token & Tokenizer?
LLMs verarbeiten Text nicht als Wörter oder Buchstaben, sondern als Tokens: häufige Zeichenfolgen, meist Wortbestandteile. Der Tokenizer zerlegt Text in diese Einheiten; jedes Token wird intern zu einer Zahl. Faustregel für Deutsch/Englisch: ein Token ≈ ¾ Wort.
Abgrenzung — worauf es ankommt
Tokens erklären viele „dumme“ Fehler von LLMs: Buchstaben zählen, Wörter rückwärts schreiben oder Rechnen mit langen Zahlen scheitern oft daran, dass das Modell die Buchstaben gar nicht einzeln „sieht“. Auch Preise und Kontextfenster werden in Tokens gemessen.
Beispiel aus der Praxis
„Unternehmensberatung“ wird z. B. zu „Unternehmens“ + „beratung“ — zwei Tokens. Das berühmte Erdbeer-Beispiel: Modelle verzählten sich lange bei den „r“ in „strawberry“, weil sie Tokens statt Buchstaben verarbeiten.
Token & Tokenizer in Ihrem Unternehmen nutzen?
Von der Theorie in die Praxis: Wir zeigen Ihnen den passenden Weg — pragmatisch, DSGVO-konform und messbar.
Kostenlos · unverbindlich