Rater-State-Bias-Audit

Rater-State-Bias in RLHF Präferenzdaten

Dieser wissenschaftliche Artikel untersucht den Einfluss des Zustands der Bewertenden auf die Präferenzdaten in der menschlichen Rückmeldung für die maschinelle Lernprozesse. Er identifiziert, dass unter stressigen Bedingungen die Bewertung nicht nur die Qualität der Ausgabe widerspiegelt, sondern auch den emotionalen Zustand des Bewertenden. Dies führt zu strukturierten Bias in den Präferenzdaten, die durch Belohnungsmodelle und Policy-Optimierung weitergegeben werden können. Der Artikel entwickelt ein Hypothesenmodell und eine Prüfrahmung für diesen Bias.

Einordnung

Kategorie Prompts & Tweaks
Score 8
Relevanz Die Arbeit untersucht systemische Implikationen von Bewertungsprozessen auf der Ebene des Codes und der Anwendung, mit Auswirkungen auf die menschliche Autonomie und algorithmische Kontrolle in maschinellen Lernsystemen.

Quelle

Art Scientific Paper
Autor Elena Kopteva, Vitaliy Hlynianyi-Zhuk
Veröffentlicht am April 14, 2026
Original-Link Original-Link

Details

Stichwort Rater State Bias in RLHF Preference Data: An Audit Framework
LLM Type qwen2.5:32b-instruct-q5_K_M
Edition Daily News
Markierung Bot
Archiviert am Juli 22, 2026
Nach oben scrollen