Eval-Framework — LLM-as-a-Judge mit Bias-Korrektur

Unser Framework zur systematischen Evaluation von LLM-Outputs: Pairwise-Vergleiche, Bias-Korrekturen (Position-Swap, Verbosity, Self-Preference), Kalibrierung gegen eine menschliche Referenzbewertung mit Spearman ρ als Akzeptanz-Schwelle. Stand Juli 2026: intern entwickelt und im März 2026 einmal kalibriert. Es läuft noch nicht als dauerhaftes Quality-Gate und war noch in keinem Kundenmandat im Einsatz.

Python 3.13SQLitePydanticPrometheus2-JudgeOllama

Warum LLM-as-a-Judge — und warum mit Bias-Korrektur

Subjektive Output-Qualität (Hilfreichkeit, Vollständigkeit, Tonalität) skaliert nicht durch Menschen — für eine Stichprobe von 200 Antworten braucht ein menschlicher Reviewer einen Tag, für tägliche Quality-Gates ist das unwirtschaftlich. LLM-as-a-Judge ist die Antwort, hat aber drei systematische Bias-Probleme: Position-Bias (der erste Vergleichs-Eintrag wird bevorzugt), Verbosity-Bias (längere Antworten werden überschätzt), Self-Preference (ein Modell bevorzugt seine eigenen Outputs). Unser Framework korrigiert alle drei mit dokumentierten Methoden — Position-Swap-Averaging, Verbosity-Normalisierung, Generator-Judge-Trennung.

Kalibrierung gegen Human-Baselines

Ein Judge-Modell ist nur dann nutzbar, wenn seine Urteile mit menschlichen Urteilen korrelieren. Wir messen das mit Spearman-Rang-Korrelation (Akzeptanz-Schwelle ρ ≥ 0.7). Im Kalibrierungslauf vom 20. Juli 2026 erreichte unser Default-Judge qwen2.5:14b ρ = 0.81 für Relevance und ρ = 0.90 für Faithfulness (Mittel aus drei Läufen) — über zwanzig Anchor-Samples gegen die Bewertung eines einzelnen menschlichen Raters. Diese Werte liegen unter den zuvor publizierten 0.89 und 0.78, und der Grund ist lehrreich genug, um ihn zu nennen: Bis dahin kalibrierten wir gegen einen schmaleren Prompt als den, der produktiv läuft. Gemessen auf dem echten Pfad fällt die Zahl. Dieselbe Erfahrung hatten wir schon einmal — bei RAG-Wissen fiel eine Faithfulness-Baseline von 0.900 auf 0.650, als der Runner auf den Produktionspfad umgestellt wurde. Die Regel daraus gilt für uns selbst: auf dem Produktionspfad messen oder gar nicht. Weitere Grenzen nennen wir mit: zwanzig Samples und ein Rater sind ein Startpunkt, keine belastbare Baseline; kalibriert sind nur zwei der fünf Dimensionen, die übrigen drei tragen zusammen 60 Prozent zum Gesamtscore bei und sind im Report als ungeprüft ausgewiesen; und das Krippendorff-α misst die Übereinstimmung der Judge-Modelle untereinander, nicht die mit dem Menschen. Vorgesehen ist, alle 50 Evaluations 5 Kalibrierungs-Samples einzustreuen, um Modell-Drift zu erkennen — implementiert, aber mangels laufendem Produktivbetrieb noch nicht in Anwendung.

Wofür das Framework gedacht ist

Wer KI-Pipelines im KMU produktiv führt, kommt nicht ohne objektive Qualitäts-Messung aus — und subjektive Reviews skalieren spätestens ab der zweiten Produktiv-Pipeline nicht mehr. Das Eval-Framework ist als Startpunkt dafür angelegt: konfigurierbare Rubrics für gängige Use Cases (Customer Service, Wissens-Beantwortung, Content-Generierung), Beispiel-Skripte, dokumentierte Bias-Korrekturen. Der Plan ist, es gegen die Use Cases eines Mandats aufzusetzen und als interne Fähigkeit zu übergeben — Ziel ist nicht Vendor-Lock-in, sondern KI-Kompetenz im Haus. Diesen Schritt sind wir bisher nicht gegangen; wer heute mit uns arbeitet, bekommt die Methode, nicht ein fertig eingefahrenes Produkt.