Rater-State-Bias-Audit
Rater-State-Bias in RLHF Präferenzdaten
KI-Systeme bilden stärkere Stereotypen als Menschen.
AI-Coercion Benchmark untersucht Reaktionen auf Widerstand
Steuerungsschicht reduziert Ausgabevarianz und Fehlerquoten.
Modelliert Meinungsdynamik bei der Impfung mit kognitiven Modulen.
LLMs erzeugen vorhersagbare Antworten, was für kreative Aufgaben ein Hindernis darstellt.
Kontrollierbarkeit synthetischer Bevölkerungen durch Sprachmodelle untersucht.
Instruction Bleed beeinflusst unbemerkt das Verhalten anderer Module.
Forschungsagenten können private Informationen durch externe Abfragen preisgeben.
Studie bestätigt pro-frauen Bias in japanischen LLM-Rekrutierungen
Fehlalarme verursachen Schaden an Brückenbenutzern