scaleyour.ai
3 · Wie ein LLM trainiert wird

Pretraining

Vortraining

Auf einen Blick

Pretraining ist die erste und teuerste Trainingsphase: Das Modell lernt self-supervised auf Billionen Tokens, immer nur das nächste Token vorherzusagen.

Was bedeutet Pretraining?

Die erste und mit Abstand teuerste Phase: Das Modell lernt self-supervised auf Billionen von Tokens (Webseiten, Bücher, Code, Artikel), immer nur das nächste Token vorherzusagen. Dabei entstehen Sprachgefühl, Faktenwissen und Schlussfolgerungsfähigkeit — komprimiert in den Gewichten.

Abgrenzung — worauf es ankommt

Das Ergebnis ist ein Base Model: ein reiner Textvervollständiger, der noch kein Assistent ist. Fragt man ein Base Model „Wie backe ich Brot?“, antwortet es womöglich mit fünf weiteren Fragen, weil das im Web-Training so oft nach Fragen kam. Deshalb braucht es die nächsten Stufen.

Beispiel aus der Praxis

Größenordnung heutiger Frontier-Modelle: mehrere Billionen Trainings-Tokens, zehntausende GPUs, Monate Rechenzeit, Kosten im hohen zwei- bis dreistelligen Millionenbereich.

Zum Weiterdenken

Das „P“ in GPT steht für Pre-trained. Wichtig ist die Datenkuration: Qualität und Mischung der Daten beeinflussen das Modell stärker als reine Menge (Stichwort Chinchilla-Skalierungsgesetze: Parameterzahl und Datenmenge müssen im Verhältnis stehen). Nach dem Pretraining steht auch der Knowledge Cutoff fest — das Datum, bis zu dem das Modell Weltwissen hat.

Pretraining in Ihrem Unternehmen nutzen?

Von der Theorie in die Praxis: Wir zeigen Ihnen den passenden Weg — pragmatisch, DSGVO-konform und messbar.

Kostenlos · unverbindlich