AI Agent Benchmarks Auditing
BenchJack identifiziert Schwachstellen in AI-Benchmarks.
BenchJack identifiziert Schwachstellen in AI-Benchmarks.
Bewertungsmaßstab für Mechanismus-Plausibilität entwickelt
Untersuchung von Informationsasymmetrien und Verträgen zwischen Agenten
Spektrale Methode zur Identifizierung verborgener Koalitionen
Benchmark für agiles Systemverhalten mit unvollständigen Daten
Optimierung der Kommunikation in LLM-MAS durch aktives Lernen
MemFlow verbessert kleine Sprachmodelle bei langfristigen Aufgaben.
Effizientere Datenkommunikation ohne Tracking-Performance-Schwächen
LOCA erklärt erfolgreiche Jailbreak-Angriffe durch kausale Änderungen.
Isolierte Selbstkorrektur übertrifft unstrukturierte homogene Debatte.
Untersuchung von LLM-basierten sozialen Simulationen
MARS koordiniert GPU-CPU-Ressourcen zur Latenzreduktion.
HASE erreicht bis zu 33 Millionen Schritte pro Sekunde.