RLHF kombiniert maschinelles Lernen mit menschlicher Bewertung. Dabei werden Antworten eines Modells von Menschen eingeschätzt, damit das System lernt, welche Ausgaben bevorzugt und welche vermieden werden sollen.
Menschen können besser beurteilen, ob Antworten hilfreich, verständlich, sicher oder unangemessen sind. Dieses Feedback hilft dabei, Modelle stärker an menschlichen Erwartungen auszurichten.
RLHF ist ein wichtiger Schritt bei der Entwicklung heutiger Assistenten, weil es die Qualität und Steuerbarkeit von Antworten verbessert. Es trägt wesentlich dazu bei, dass Systeme alltagstauglicher wirken.
RLHF baut auf dem Prinzip des Reinforcement Learning auf und überträgt es auf die Entwicklung von Sprachmodellen.