scaleyour.ai
3 · Wie ein LLM trainiert wird

RLHF

Reinforcement Learning from Human Feedback

Auf einen Blick

RLHF ist die Alignment-Stufe: Menschen ranken Modell-Antworten, daraus wird ein Reward Model, und das LLM wird per Reinforcement Learning darauf optimiert.

Was bedeutet RLHF?

Die Alignment-Stufe: Menschen bekommen mehrere Modell-Antworten auf dieselbe Frage und ranken sie (welche ist hilfreicher, ehrlicher, unbedenklicher?). Aus diesen Rankings wird ein Reward Model trainiert, das menschliche Vorlieben vorhersagt — und mit Reinforcement Learning wird das LLM dann so optimiert, dass es Antworten erzeugt, die dieses Reward Model hoch bewertet.

Abgrenzung — worauf es ankommt

RLHF ist kein eigenes Lernparadigma, sondern Reinforcement Learning, angewandt auf LLMs — die „Umgebung“ ist der Dialog, die „Belohnung“ kommt vom Reward Model statt aus einem Spielergebnis. Und: RLHF fügt kein Wissen hinzu, es formt das Verhalten (Ton, Hilfsbereitschaft, Verweigern schädlicher Anfragen). Häufiger Versprecher: es heißt „Human Feedback“, nicht „Real Life Feedback“.

Beispiel aus der Praxis

RLHF war der entscheidende Unterschied zwischen GPT-3 (beeindruckend, aber sperrig) und ChatGPT (angenehm nutzbar) — und damit ein Hauptauslöser des KI-Booms ab Ende 2022.

Zum Weiterdenken

Klassisch wird dafür der RL-Algorithmus PPO genutzt. Modernere Alternativen: DPO (Direct Preference Optimization — lernt direkt aus den Paarvergleichen, ohne separates Reward Model, einfacher und stabiler) und RLAIF / Constitutional AI (Anthropic: Feedback kommt teilweise von einer KI anhand schriftlicher Prinzipien statt nur von Menschen). Bekannte Schwäche von RLHF: kann zu übertriebener Gefälligkeit führen („Sycophancy“).

RLHF in Ihrem Unternehmen nutzen?

Von der Theorie in die Praxis: Wir zeigen Ihnen den passenden Weg — pragmatisch, DSGVO-konform und messbar.

Kostenlos · unverbindlich