Rater-State-Bias-Audit
Rater-State-Bias in RLHF Präferenzdaten
KI-Systeme bilden stärkere Stereotypen als Menschen.
LLMs erzeugen vorhersagbare Antworten, was für kreative Aufgaben ein Hindernis darstellt.
Klassische Modelle fehlen, Bias verbessert Vorhersage.
Studie bestätigt pro-frauen Bias in japanischen LLM-Rekrutierungen
Analyse der Taktiken verdeckter KI-Agenten in Diskussionen.
Einfache Methoden genügen zur Kompromittierung von KI-gestützten Systemen.
Consilium-Protokoll für kollaborative AI-Deliberation
APS reduziert Online-Abfragen und kontrolliert Bias.
Sprachmodelle produzieren fairere Outputs, behalten aber internen Bias bei.
Architekturheterogenität reduziert Konsensbildung.
Artikel untersucht das „Agreement Trap“ bei regelgeleiteten AI-Evaluation.