Kapitel

kontinent / evals

Literaturverzeichnis

Alle Quellen, auf die sich dieser Leitfaden stützt.

Hier steht alles, worauf sich dieser Leitfaden stützt. Zu jeder Quelle steht, wofür sie taugt und wie viel Gewicht sie trägt. Die Konfidenz sagt, wie gut eine Aussage belegt ist. Sie sagt nicht, wie sehr wir ihr zustimmen.

Manche Zahl in einem Kapitel stammt aus Sekundärberichten statt aus einer geprüften Primärquelle. Dann sagt das Kapitel das, und der Eintrag hier wiederholt es.

Die Praktiker-Methode

Hamel Husain & Shreya Shankar, LLM Evals: Everything You Need to Know (Evals-FAQ), Mai 2025 · hamel.dev · Ebene C · Konfidenz: hoch Die dichteste Praktikerquelle, die es gibt. Sie entstand aus dem Unterricht von Tausenden Ingenieuren. Fast jede konkrete Zahl in Fehleranalyse und Datensatz-Design stammt von hier: 50–100 Traces zum Start, Sättigung bei etwa 20 sauberen Traces, 100+ je Review-Zyklus, 60–80 % der Entwicklungszeit, 100+ Beispiele für die CI.

Hamel Husain, Creating a LLM-as-a-Judge That Drives Business Results · hamel.dev · Ebene B/C · Konfidenz: hoch Die Judge-Methode in sieben Schritten aus Einen ausgerichteten LLM-Judge bauen. Binäre Urteile mit Kritik. Kritiken als Few-Shot-Beispiele. Precision und Recall statt bloßer Übereinstimmung. Fehleranalyse je Teilmenge.

Eugene Yan, Evaluating the Effectiveness of LLM-Evaluators, Aug. 2024 · eugeneyan.com · Ebene B · Konfidenz: hoch Eine Zusammenfassung von rund zwei Dutzend Arbeiten. Jede Korrelationszahl und jede Bias-Effektgröße in Wo LLM-Judges versagen stammt von hier. Kein anderes Dokument hilft so gut dabei, realistische Erwartungen an Judges zu setzen.

Eugene Yan, An LLM-as-Judge Won't Save The Product — Fixing Your Process Will · eugeneyan.com · Ebene C · Konfidenz: hoch Das Gegengewicht zur Suche nach dem richtigen Tool.

Shankar, Zamfirescu-Pereira, Hartmann, Parameswaran, Arawjo, Who Validates the Validators?, UIST 2024 · arXiv:2404.12272 · Ebene B/C · Konfidenz: hoch Benennt und belegt die Kriteriendrift. Das formale Argument dafür, erst Daten zu lesen und dann eine Rubric zu schreiben.

Anthropic, Demystifying evals for AI agents, Jan. 2026 · Anthropic Engineering Blog · Ebene B/C · Konfidenz: hoch Agenten-Evals als Systemtests. Zustand prüfen statt Wortlaut. Umgebungen, die sich zurücksetzen lassen. Mehrere Versuche je Aufgabe. Getrennte Suiten für Regression und Fähigkeit. Jede Woche eine Stichprobe von Transkripten lesen.

Anthropic, Define your success criteria und das Evals-Cookbook · docs.anthropic.com · Ebene B · Konfidenz: hoch

LLM-as-Judge

Liu et al., G-Eval, März 2023 · arXiv:2303.16634 · Ebene B · Konfidenz: hoch Der Judge füllt ein Formular aus, denkt dabei in Schritten und gewichtet die Note mit Wahrscheinlichkeiten. Durchschnittliches Spearman ρ 0,514. Historischer Kontext. Lesen Sie die Arbeit vor allem aus einem Grund: Die meisten Implementierungen, die sich G-Eval nennen, sind keines.

A Survey on LLM-as-a-Judge · arXiv:2411.15594 · Ebene B · Konfidenz: hoch · Für die Einteilung nutzen, nicht für Zahlen.

Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge, Okt. 2024 · arXiv:2410.02736 · Ebene B · Konfidenz: hoch

Self-Preference Bias in LLM-as-a-Judge, Okt. 2024 · arXiv:2410.21819 · Ebene B · Konfidenz: hoch

Judging the Judges: A Systematic Study of Position Bias, IJCNLP 2025 · ACL Anthology · Ebene B · Konfidenz: hoch

Am I More Pointwise or Pairwise? Position Bias in Rubric-Based LLM-as-a-Judge, Feb. 2026 · arXiv:2602.02219 · Ebene B · Konfidenz: mittel Der Positions-Bias bleibt auch bei Rubrics für Einzelbewertungen bestehen. Wichtig, wenn Sie genau deshalb auf Rubrics umgestiegen sind.

Mehrsprachigkeit

How Reliable is Multilingual LLM-as-a-Judge?, EMNLP Findings 2025 · ACL Anthology · Ebene B · Konfidenz: hoch Durchschnittliches Fleiss' κ ≈ 0,3 über alle Sprachen.

Does the Judge Prefer English?, Juni 2026 · arXiv:2606.14278 · Ebene B · Konfidenz: hoch Vier API-Judges, 419 LLMBar-Paare, 13.408 Urteile. Geprüft wurden Englisch, Chinesisch und Varianten mit Sprachwechsel. Gegenüber Englisch kippten 10,7–14,4 % der Präferenzen. Alle Judges waren auf Englisch am genauesten. Die Arbeit liefert aber selbst einen Gegenbefund, und dieser Leitfaden gibt ihn wieder: Bei übersetzungsgleichen Proben mit Gleichstand gab es keine systematische Vorliebe für Englisch. Fiel eine Entscheidung, fiel sie öfter zugunsten des Chinesischen. Der Befund lautet also: Der Judge wird beim Sprachwechsel instabil. Er lautet nicht: Der Judge bevorzugt pauschal Englisch.

Challenges and Recommendations for LLMs-as-a-Judge in Multilingual Settings and Low-Resource Languages, Juli 2026 · arXiv:2607.02235 · Ebene B · Konfidenz: hoch Bei Sprachen mit wenig Trainingsdaten fällt die Leistung besser aus, als sie ist.

Towards Reliable Multilingual LLMs-as-a-Judge, Mai 2026 · arXiv:2605.28710 · Ebene B · Konfidenz: mittel

Agenten

τ-bench (Yao et al., 2024) · arXiv:2406.12045 · Ebene A · Konfidenz: hoch Führte pass^k ein: „a new metric (pass^k) to evaluate the reliability of agent behavior over multiple trials“. Die besten Agenten der Zeit waren laut Arbeit „quite inconsistent (pass^8 <25% in retail)“. Nehmen Sie die Kennzahl mit, nicht den Benchmark.

τ²-bench (Barres et al., Juni 2025) · arXiv:2506.07982 · GitHub · Ebene A · Konfidenz: hoch für den Dual-Control-Entwurf; die in Sekundärtexten kursierenden Aufgabenzahlen je Domäne (airline 50, retail 114, telecom 114) stehen weder im Abstract noch im README und werden in diesem Leitfaden nicht wiedergegeben. Erweitert τ-bench um eine Umgebung mit zwei Steuernden. Dort gilt: „both agent and user make use of tools to act in a shared, dynamic environment“.

Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents, Okt. 2025 · arXiv:2510.02837 · Ebene B · Konfidenz: hoch

Holistic Agent Leaderboard, Okt. 2025 · arXiv:2510.11977 · Ebene A · Konfidenz: mittel Die Gesamtwerte von Agenten verdecken Unterschiede bei Kosten und Zuverlässigkeit.

Berkeley Function Calling Leaderboard v4, ICML 2025 · gorilla.cs.berkeley.edu · Ebene A/B · Konfidenz: hoch Vergleicht den Syntaxbaum (AST) eines Tool-Aufrufs deterministisch mit einem Referenzaufruf. Diese Technik können Sie direkt für eigene Tool-Aufruf-Evals übernehmen.

OSWorld, WebArena, VisualWebArena, GAIA, BrowseComp, AssistantBench · Ebene A · Konfidenz: mittel · Die Benchmarks für Browser- und Computer-Agenten. OSWorld deckt 369 Aufgaben auf einem vollständigen Desktop ab. OSWorld 2.0 (arXiv:2606.29537) ergänzt Aufgaben mit langem Horizont.

Coding und Benchmark-Verfall

OpenAI, Why we no longer evaluate SWE-bench Verified, Feb. 2026 · openai.com · Ebene A · Konfidenz: hoch, aus der Primärquelle gelesen Aus der Primärquelle geprüft, 2026-08-28. Sättigung: Der Spitzenwert stieg in sechs Monaten nur von 74,9 % auf 80,9 %. Mängel: OpenAI nahm 138 Aufgaben unter die Lupe, eine Teilmenge von 27,6 % der 500. Das Modell o3 hatte sie „did not consistently solve over 64 independent runs“. Jede Aufgabe prüften mindestens sechs erfahrene Softwareentwickler unabhängig voneinander. Alles Markierte prüfte ein weiteres Team noch einmal. 59,4 % enthielten wesentliche Mängel im Testdesign und/oder in der Aufgabenbeschreibung: 35,5 % zu enge Testfälle, die nicht genannte Implementierungsdetails erzwingen, 18,8 % zu weite Testfälle, die nie erwähnte Funktionen prüfen, 5,1 % Sonstiges. Belege für Kontamination: Modelle gaben Gold-Patches und Aufgabenstellungen wortgleich wieder. Und: „models that have seen the problems during training are more likely to succeed, because they have additional information needed to pass the underspecified tests“.

SWE-bench Pro · Ebene A · Konfidenz: mittel · 1.865 Aufgaben, 41 Repositories, ein großer zurückgehaltener Anteil. OpenAI hat die Empfehlung im Juli 2026 zurückgezogen, siehe unten.

OpenAI, Separating signal from noise in coding evaluations, Juli 2026 · openai.com · Ebene A · Konfidenz: hoch, aus der Primärquelle gelesen OpenAI zog die eigene Empfehlung für SWE-bench Pro zurück. Der Benchmark messe „no longer reliably ... frontier coding capability“, und „30% of SWE-Bench Pro tasks“ seien defekt. Prüfmethode: modellbasierte Prüf-Agenten plus fünf unabhängige, erfahrene Softwareentwickler. Die automatische Pipeline markierte 200 Aufgaben (27,4 %). Die menschlichen Prüfer markierten 249 (34,1 %). Die Fehlerklassen, nach Größe geordnet: zu strenge Tests, unklare Aufgabenstellungen, Tests mit geringer Abdeckung, irreführende Aufgabenstellungen. Faros AI kam unabhängig auf dieselben rund 30 %. Faros ist ein Anbieter mit offengelegtem Produktinteresse und prüfte 152 strittige Fälle von Hand. Der übertragbare Punkt: Ein Test, der einen Pull Request absichern sollte, ist keine Spezifikation von Korrektheit. Für Teams, die ihre eigene Repository-Historie auswerten, ist das der nützlichste Befund in diesem Verzeichnis.

UTBoost: Rigorous Evaluation of Coding Agents on SWE-Bench, Juni 2025 · arXiv:2506.09289 · Ebene A · Konfidenz: mittel

Kontamination

A Survey on Data Contamination for Large Language Models, Feb. 2025 · arXiv:2502.14425 · Ebene A · Konfidenz: hoch Gegenmaßnahmen: Labels schützen, Canary-Strings einbauen, verschlüsseln, im Nachhinein erkennen, Benchmarks dynamisch erzeugen.

AntiLeakBench, ACL 2025 · ACL Anthology · Ebene A · Konfidenz: hoch

LLM Benchmark Datasets Should Be Contamination-Resistant, Mai 2026 · arXiv:2605.19999 · Ebene A · Konfidenz: mittel

Rethinking Benchmark and Contamination for Language Models with Rephrased Samples, 2023 · arXiv:2311.04850 · Ebene A · Konfidenz: hoch 8–18 % von HumanEval kommen auch in RedPajama-Data-1T und StarCoder-Data vor. Wer eine Testaufgabe umformuliert oder übersetzt, umgeht die Dekontamination per n-Gramm. Danach gilt: „a 13B model can easily overfit a test benchmark and achieve drastically high performance, on par with GPT-4“.

A Careful Examination of Large Language Model Performance on Grade School Arithmetic (GSM1k), Scale AI, 2024 · arXiv:2405.00332 · Ebene A · Konfidenz: hoch Eine von Hand geschriebene Nachbildung von GSM8k. Sie gleicht dem Original in Stil, Schwierigkeit, menschlicher Lösungsquote, Zahl der Lösungsschritte und Größe der Ergebnisse. Die Genauigkeit fiel um bis zu 8 %. Mehrere Modellfamilien zeigten systematische Überanpassung. Die Spitzenmodelle blieben überwiegend sauber. Spearmans r² = 0,36 zwischen zwei Größen: wie wahrscheinlich ein Modell ein GSM8k-Beispiel erzeugt, und wie groß seine Lücke zwischen GSM8k und GSM1k ist.

Korrektur 2026-08-28: Frühere Fassungen dieses Leitfadens nannten „~40 % von HumanEval“ und einen Einbruch von „~13 Punkten“ bei GSM8K. Beide Zahlen stammten aus Sekundärquellen und sind falsch. Geprüft sind 8–18 % und bis zu 8 %. Außerdem ist das GSM1k-Ergebnis ein Vergleich mit einem frischen Benchmark, kein Dekontaminations-Experiment. Die Aussage zur Reproduktion der BIG-Bench-Canary-GUID ließ sich auf keine Primärquelle zurückführen. Wir haben sie entfernt.

RAG

RAGAS-Dokumentation · docs.ragas.io · Ebene B · Konfidenz: hoch · Hier kommen die üblichen Namen der Kennzahlen her.

RAGChecker, NeurIPS 2024 · arXiv:2408.08067 · Ebene B · Konfidenz: hoch Prüft je Aussage, ob sie aus den Quellen folgt. So trennt die Methode Fehler des Retrievers von Fehlern des Generators. In der Meta-Evaluationstabelle der Arbeit geprüft: Pearson 61,93 mit menschlicher Präferenz beim Gesamturteil. Die stärkste Baseline RAGAS kommt auf 48,31. Dahinter ROUGE-L 43,10, TruLens 35,15, BLEU-avg 35,14, BERTScore 33,51, ARES 17,81.

ARES · Ebene B · Konfidenz: mittel · Synthetische Daten plus leichtgewichtige Judges. Kalibriert mit Prediction-Powered Inference.

Statistik und Harness

Evan Miller, Adding Error Bars to Evals, Nov. 2024 (Anthropic) · arXiv:2411.00640 · Ebene C · Konfidenz: hoch Fünf Empfehlungen. Standardfehler über den zentralen Grenzwertsatz berechnen. Bei gruppierten Fragen geclusterte Standardfehler nutzen. Varianz senken, indem man mehrfach zieht und Next-Token-Wahrscheinlichkeiten nutzt. Zwei Modelle gepaart vergleichen. Vorab eine Power-Analyse machen. Am Text der Arbeit geprüft: „Clustered standard errors can be over 3X larger than naive standard errors“ (DROP zeigt ein Verhältnis von 3,05); „using paired differences will reduce the variance of the estimator by 1/3 in relative terms“; und das Rechenbeispiel „increasing KA=KB from 1 to 10 reduces the Minimum Detectable Effect from 13.2% to 7.5%“.

A Single Character can Make or Break Your LLM Evals, Okt. 2025 · arXiv:2510.05152 · Ebene A/C · Konfidenz: hoch Allein die Wahl des Delimiters verschiebt MMLU um bis zu ±23 %. In der Arbeit je Modell geprüft: Llama-3.1-8B 18,3 %, Qwen2.5-7B 23,5 %, Gemma-2-9B 29,4 %. Auch auf ARC-Challenge, CommonsenseQA, Banking77 und TACRED getestet. „One can manipulate model rankings to put any model in the lead by only modifying the single character separating examples“. Die Brüchigkeit „doesn't improve with scale“. Wer den Delimiter im Prompt benennt, gewinnt 1,5–27,9 % Robustheit. Das stärkste Argument dafür, das Prompt-Format festzunageln.

The Leaderboard Illusion, Apr. 2025 · arXiv:2504.20879 · Ebene A · Konfidenz: hoch Dazu die Antwort von LMArena: news.lmarena.ai. Lesen Sie beides.

Tools

Inspect (UK AI Security Institute) · inspect.aisi.org.uk · GitHub · Konfidenz: hoch

EleutherAI lm-evaluation-harness, HuggingFace lighteval · Konfidenz: hoch

OpenAI Evals (abgekündigt) · Abkündigung · Migration zu promptfoo · Konfidenz: hoch Angekündigt am 3. Juni 2026. Nur noch lesbar ab 31. Oktober 2026. Abschaltung am 30. November 2026.

promptfoo · promptfoo.dev · Konfidenz: hoch

DeepEval, Braintrust, LangSmith, Arize Phoenix, Langfuse, W&B Weave, Evidently, MLflow · Konfidenz: hoch, dass es sie gibt und sie tun, was sie sagen; niedrig für jeden veröffentlichten Vergleich Jeder gut auffindbare Vergleich dieser Tools stammt von einem der Anbieter selbst. Behandeln Sie Vergleichsseiten als Werbung. Prüfen Sie jede Aussage in der Originaldokumentation.

Sicherheit

HarmBench · Überblick · Ebene A · Konfidenz: hoch

AILuminate (MLCommons, Dez. 2024) · Ebene A · Konfidenz: hoch · 12 Gefahrenkategorien, 24.000 Prompts.

AgentHarm · Überblick · Ebene A · Konfidenz: hoch · 11 Schadenskategorien. Misst, wie bereitwillig ein Agent bösartige Aufgaben in mehreren Schritten zu Ende führt.

CyberSecEval (Wan et al., 2024) · Ebene A · Konfidenz: mittel

International AI Safety Report 2026, Feb. 2026 · arXiv:2602.21012 · Ebene A · Konfidenz: hoch

Ergänzt im zweiten Recherchedurchgang (2026-08-28)

Diese Quellen kamen dazu, um die dünnen Kapitel zu stützen: CI, Produktion, Sicherheit und den Abschnitt zu strukturierter Ausgabe im Kapitel über code-basierte Evals.

Towards More Standardized AI Evaluation: From Models to Agents, Feb 2026 · arXiv:2602.18029 · Ebene A/B · Konfidenz: hoch Beschreibt den Wechsel vom Blick auf das Modell zum Blick auf den Agenten. Evaluation sei dadurch zu „a core control function“ geworden. Daher stammt die Einordnung in Die drei Ebenen.

Let Me Speak Freely? A Study on the Impact of Format Restrictions, EMNLP 2024 Industry Track · ACL Anthology · arXiv:2408.02442 · Ebene A/B · Konfidenz: hoch Unter Formatvorgaben denkt das Modell schlechter. Je strenger die Vorgabe, desto stärker der Verlust. Ursache ist die falsche Reihenfolge in der Ausgabe. Ablationen mit Schemas zeigen Gegenbelege. Deshalb steht das Thema in Code-basierte Evals als umstritten.

When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications, 2026 · arXiv:2601.22025 · Ebene B/C · Konfidenz: hoch Schlägt die Minimum Viable Evaluation Suite vor. Allgemeine Prompt-Zusätze helfen nicht immer. Bei einem Modell fiel die Zitiertreue im RAG von 26/30 auf 9/30, sobald allgemeine Regeln angehängt wurden. Das ist der empirische Grund, warum Evals in der CI jede Prompt-Änderung vor dem Merge prüft.

Dwork, Feldman, Hardt, Pitassi, Reingold, Roth: Generalization in Adaptive Data Analysis and Holdout Reuse, 2015 · arXiv:1506.02629 · Ebene C · Konfidenz: hoch Thresholdout: Ein zurückgehaltenes Set wird mit Rauschen versehen. So verträgt es quadratisch mehr adaptive Abfragen.

Recht et al.: ImageNet test-set reproduction, and Mania et al.: Model Similarity Mitigates Test Set Overuse, 2019 · arXiv:1905.12580 · Ebene C · Konfidenz: mittel Auf einem neu gebauten Testset sank die absolute Genauigkeit. Der Anteil durch adaptive Überanpassung war aber „limited to non-existent“. Aufgaben mit vielen Klassen halten die Wiederverwendung des Testsets aus. Deshalb stellt Evals in der CI die Überanpassung an Eval-Sets als umstritten dar, nicht als geklärt.

OpenTelemetry GenAI semantic conventions · opentelemetry.io · Ebene C · Konfidenz: hoch Die gen_ai.*-Span-Attribute, getragen von der CNCF. Die GenAI-SIG entstand im April 2024. Der Geltungsbereich umfasst inzwischen Agenten-Orchestrierung, MCP-Tool-Aufrufe und Qualitätsbewertung. Google Cloud, AWS, Azure und Datadog setzen den Standard um. Grundlage der Empfehlung zur Instrumentierung in Online-Evaluation.

Chapelle, Joachims, Radlinski & Yue: Large-scale validation and analysis of interleaved search evaluation, TOIS 30(1), Artikel 6, Feb. 2012 · 10.1145/2094072.2094078 · Ebene C · Konfidenz: hoch · Die Validierung von Interleaving im großen Maßstab.

Radlinski & Craswell: Optimized interleaving for online retrieval evaluation, WSDM 2013 · Semantic Scholar · Ebene C · Konfidenz: hoch Die eigentliche Quelle der Aussage zur Empfindlichkeit: 38 große Online-Experimente, über 3 Milliarden Klicks. Interleaving ist ein bis zwei Größenordnungen empfindlicher als A/B-Tests und stimmt bis zu 22 % besser mit A/B-Kennzahlen überein. Verlinkt über Semantic Scholar. Die DOI-Seite der ACM liegt hinter einer Bot-Prüfung, wir konnten sie von hier nicht öffnen. Nach der unten vermerkten Fehlzitation drucken wir kein DOI, das wir nicht selbst aufgelöst haben.

Korrektur 2026-08-28: Eine frühere Fassung nannte für Chapelle et al. das DOI 10.1145/2071389.2071390. Dieses DOI gehört zu einer ganz anderen Arbeit (Carpineto & Romano, „A Survey of Automatic Query Expansion in Information Retrieval“). Außerdem war die Zahl zur Empfindlichkeit Chapelle et al. zugeschrieben statt Radlinski & Craswell. Beides ist behoben.

OWASP Top 10 for LLM Applications, 2025 · owasp.org · Ebene B · Konfidenz: hoch Prompt Injection steht zum zweiten Mal in Folge auf LLM01. Excessive Agency steht auf LLM06. System-Prompt-Leakage ist neu dabei.

XSTest, 2023 · arXiv:2308.01263 · Ebene A · Konfidenz: hoch · 250 harmlose Prompts in zehn Typen, dazu 200 unsichere Gegenstücke.

OR-Bench, ICML 2025 · arXiv:2405.20947 · Ebene A · Konfidenz: hoch · 80.000 Prompts, die Modelle zu Unrecht ablehnen, in 10 Kategorien. Dazu eine harte Teilmenge von rund 1.000, 600 toxische Prompts und 32 LLMs aus 8 Modellfamilien. Im Abstract geprüft.

AgentDojo, NeurIPS 2024 · arXiv:2406.13352 · Ebene A/B · Konfidenz: hoch 97 realistische Nutzeraufgaben aus E-Mail, Online-Banking und Reisebuchung. 629 Sicherheitstestfälle. „State-of-the-art LLMs fail at many tasks (even in the absence of attacks)“ und „existing prompt injection attacks break some security properties but not all“.

InjecAgent, 2024 · arXiv:2403.02691 · Ebene A/B · Konfidenz: mittel · Das Gegenstück zu AgentDojo für indirekte Injektion in einem einzigen Schritt.

Adaptive Attacks Break Defenses Against Indirect Prompt Injection Attacks on LLM Agents, 2025 · arXiv:2503.00061 · Ebene B · Konfidenz: hoch Veröffentlichte Abwehrmaßnahmen scheitern, sobald der Angreifer sie kennt. Deshalb setzt Sicherheit auf begrenzte Rechte vor der Erkennung.

ARES, 2023 · arXiv:2311.09476 · Ebene B · Konfidenz: mittel · Synthetische Daten plus leichtgewichtige Judges. Kalibriert mit Prediction-Powered Inference.

Ergänzt im dritten Recherchedurchgang (2026-08-30)

Ziel dieses Durchgangs: Kapitel, die nur auf einer Quelle standen, bekommen unabhängige Belege. Betroffen waren Datensatz-Design (nur Husain/Shankar), Statistik (nur Miller) und die Judge-Fehlermodi (überwiegend Eugene Yan).

Zheng et al., Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena, NeurIPS 2023 · arXiv:2306.05685 · Ebene A · Konfidenz: hoch Die Primärquelle für Positions-, Verbositäts- und Self-Enhancement-Bias. Die Zahlen in wo Judges versagen stammen von hier. Wir haben sie am Volltext geprüft: Position 50,0 % / 75,0 % (Tabelle 2), „repetitive list“ 91,3 % gegen 8,7 % bei gpt-4 (Tabelle 3), Self-Enhancement +10 % / +25 % (Abbildung 2b). Den letzten Wert nennen die Autoren selbst nicht zweifelsfrei belegt.

Panickssery, Bowman & Feng, LLM Evaluators Recognize and Favor Their Own Generations · arXiv:2404.13076 · Ebene A · Konfidenz: hoch Ein eigener Mechanismus hinter der Selbstbevorzugung: Je besser ein Modell eigene Texte erkennt, desto stärker bevorzugt es sie. Der Zusammenhang ist linear.

Artstein & Poesio, Inter-Coder Agreement for Computational Linguistics, 2008 · ACL Anthology J08-4004 · Ebene A · Konfidenz: hoch Der Standardüberblick zu Übereinstimmungsmaßen. Liefert die strengere Schwelle (κ > 0,8). Sie ist der Gegenpol zur Praktikerschwelle in Datensatz-Design. Die Stufen selbst gehen auf Landis & Koch, Biometrics 33(1), 1977 zurück. Deren Autoren nennen sie selbst willkürlich.

Kiritchenko & Mohammad, Best-Worst Scaling More Reliable than Rating Scales, ACL 2017 · arXiv:1712.01765 · Ebene A · Konfidenz: hoch Ein empirischer Beleg aus der Annotationsforschung gegen abgestufte Bewertungsskalen. Das Heilmittel ist ein anderes als das binäre Label. Die Diagnose ist dieselbe.

Guest, Bunce & Johnson, How Many Interviews Are Enough?, Field Methods 18(1), 2006 · Semantic Scholar · Ebene A · Konfidenz: hoch Die empirische Grundlage für theoretische Sättigung. Nach zwölf Interviews tritt Sättigung ein. Die Grundzüge stehen schon nach sechs. Verlinkt über Semantic Scholar, weil SAGE automatische Abrufe blockiert. DOI 10.1177/1525822X05279903.

Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity · arXiv:2510.01171 · Ebene A/B · Konfidenz: mittel Ein unabhängiger Beleg dafür, dass naives Prompting nur wenige typische Ausgaben liefert. Die Ursache liegt in den Präferenzdaten (typicality bias).

Messing, Hidden Measurement Error in LLM Pipelines, 2026 · arXiv:2604.11581 · Ebene A/B · Konfidenz: mittel Eine unabhängige zweite Quelle für Statistik. Naive Standardfehler sind 40–60 % zu klein, wenn man die Varianz aus Judge-Wahl, Temperatur und Prompt-Formulierung weglässt.

Kish, Survey Sampling, 1965 · Moulton, 1986 · Ebene A · Konfidenz: hoch Der klassische Ursprung des Design-Effekts. Belegt, dass das Clustering-Problem in Statistik keine Eigenheit von LLMs ist.

Ergänzt im Review-Durchgang (2026-09-02)

Rogan & Gladen, Estimating prevalence from the results of a screening test, American Journal of Epidemiology 107(1), 1978 · DOI 10.1093/oxfordjournals.aje.a112510 · Ebene A · Konfidenz: hoch Die Korrektur, mit der Einen Judge bauen die wahre Bestehensquote zurückrechnet. Voraussetzung: TPR und TNR des Judges sind bekannt. Die Epidemiologie nutzt die Formel seit fünfzig Jahren für genau diese Aufgabe: ein Screening-Test mit bekannter Sensitivität und Spezifität.

Walker & Nowacki, Understanding Equivalence and Noninferiority Testing, J Gen Intern Med 26(2), 2011 · PMC3019319 · Ebene A · Konfidenz: hoch Der Denkrahmen aus klinischen Studien hinter Modellwahl. Die Nicht-Unterlegenheitsmarge wird vorab festgelegt. Wer sie verengt, braucht überproportional mehr Stichprobe. DOI 10.1007/s11606-010-1513-8.

Chen, Zaharia & Zou, FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance, 2023 · arXiv:2305.05176 · Ebene A/B · Konfidenz: mittel LLM-Kaskaden. Die „up to 98% cost reduction“ bei gleicher Leistung wie das beste Einzelmodell gilt für die Aufgaben der Arbeit. Modellwahl zitiert die Technik, nicht die Zahl.

Ong et al., RouteLLM: Learning to Route LLMs with Preference Data, 2024 · arXiv:2406.18665 · Ebene A/B · Konfidenz: mittel Router, trainiert auf menschlichen Präferenzdaten. „over 2 times“ weniger Kosten „in certain cases“ ohne Qualitätsverlust, auf den Benchmarks der Arbeit. Derselbe Vorbehalt wie bei FrugalGPT.