scaleyour.ai
3 · Wie ein LLM trainiert wird

Destillation & Quantisierung

Modelle verkleinern

Auf einen Blick

Destillation und Quantisierung machen große Modelle praxistauglich: kleiner, schneller und billiger im Betrieb bei geringen Qualitätseinbußen.

Was bedeutet Destillation & Quantisierung?

Zwei Techniken, um große Modelle praxistauglich zu machen: Bei der Destillation bringt ein großes „Lehrer“-Modell einem kleinen „Schüler“-Modell sein Verhalten bei (der Schüler trainiert auf den Ausgaben des Lehrers). Bei der Quantisierung werden die Gewichte mit geringerer Zahlengenauigkeit gespeichert (z. B. 4 Bit statt 16), was Speicher und Kosten drastisch senkt.

Abgrenzung — worauf es ankommt

Beide verändern nicht, was das Modell kann, sondern wie teuer es im Betrieb ist — mit geringen Qualitätseinbußen. Das ist die Antwort auf die Frage, warum „Mini“- und „Flash“-Varianten großer Modelle so günstig sind.

Beispiel aus der Praxis

Ein quantisiertes 8B-Modell läuft auf einem Laptop; das DeepSeek-Aufsehen Anfang 2025 beruhte u. a. stark auf Destillations- und Effizienztechniken.

Zum Weiterdenken

Noch ein Effizienz-Begriff für Fortgeschrittene: Mixture of Experts (MoE) — das Modell besteht aus vielen Teilnetzen („Experten“), pro Anfrage werden nur wenige aktiviert. So kann ein Modell riesig sein, aber pro Token nur einen Bruchteil der Parameter rechnen lassen (u. a. bei Mixtral im Einsatz).

Destillation & Quantisierung in Ihrem Unternehmen nutzen?

Von der Theorie in die Praxis: Wir zeigen Ihnen den passenden Weg — pragmatisch, DSGVO-konform und messbar.

Kostenlos · unverbindlich