Prüfstand — KI-Test-Framework
Prüfstand ist unsere Testbench für Software- und KI-Projekte: dreizehn spezialisierte Agenten für Security (SAST, Dependency- und Secret-Scan, OWASP), Codequalität und Accessibility, Funktion (Unit, E2E, API), Last sowie macOS-Signatur und Notarisierung. Ein LLM wählt die passenden Agenten pro Ziel aus, ordnet die Findings ein und fasst sie zu einem Bericht zusammen. Stand Juli 2026: Prototyp im internen Gebrauch — noch keine CI-Anbindung und kein Kundeneinsatz.
Warum systematisches Testen für KI-Systeme anders aussieht
Klassische Software ist deterministisch: gleicher Input, gleicher Output. KI-Systeme sind es nicht. Der gleiche Prompt liefert über Tage unterschiedliche Antworten, ein Modell-Update kann die Qualität still verschieben, und subjektive Dimensionen (Tonalität, Hilfreichkeit, Vollständigkeit) lassen sich nicht mit assert-Statements abdecken. Wir trennen die beiden Schichten deshalb bewusst: Prüfstand deckt ab, was maschinell entscheidbar ist — Schwachstellen, Abhängigkeiten, Secrets, Barrierefreiheit, Endpunkte, Last. Die Bewertung subjektiver Antwortqualität liegt in unserem separaten Eval-Framework, das mit LLM-as-a-Judge und Bias-Korrektur arbeitet.
Architektur — GUI für Sparring, CLI für den Batch-Lauf
Prüfstand hat zwei Ebenen: eine Electron-GUI für die explorative Phase und eine CLI für wiederholbare Läufe. Beide gehen durch denselben Orchestrator und dieselben Test-Profile (quick, security-only, standard, full), sodass ein Lauf aus der GUI ohne Übersetzungsschritt als Kommando reproduzierbar ist. Alle Agenten laufen lokal, das planende Modell wahlweise über Ollama — keine Cloud-Calls für Testdaten. Was noch fehlt, benennen wir offen: Ergebnisse liegen bisher nur im Speicher des laufenden Prozesses. Persistenz, Regressionsvergleich über die Zeit und die CI-Anbindung sind die nächsten Schritte, nicht der heutige Stand.
Wozu wir Prüfstand aufbauen
Wenn wir Kunden bei ihren ersten KI-Projekten begleiten, kommt die Frage 'wie messen wir, ob das gut genug ist?' meist zu spät — wenn die Pilot-Phase schon läuft und subjektive Eindrücke divergieren. Das Ziel von Prüfstand ist, vom ersten Tag an ein gemeinsames Mess-Setup einziehen zu können, das die Frage objektiviert: was ist die Baseline, was ist 'gut genug', wie merken wir, wenn es schlechter wird. Ein Übersetzer zwischen Engineering-Vokabular ('Latency, Throughput, p95') und Business-Vokabular ('Qualität, Vertrauen, Marken-Konsistenz'). Bis Persistenz und Regressionsvergleich stehen, arbeiten wir in Mandaten mit etablierten Standard-Werkzeugen.