Beiträge zu "evaluation"
-
Messen, ob Agenten helfen: Ergebnisse statt Eindrücke
KI-Produktivität messen: Ergebnisse statt Eindrücke, mit akzeptierten Änderungen, Review-Zeit, Nacharbeit und Kosten je akzeptierter Änderung im Metrikbaum.
-
Prompt-Injection-Tests: Agenten gegen Hijacking prüfen
Prompt injection testing koppelt eine legitime mit einer eingeschleusten Aufgabe und prüft beide Ergebnisse. Suiten für eigene Tools bauen, Eindämmung behalten.
-
LLM als Richter: nützlicher Bewerter mit bekannten Verzerrungen
LLM as a Judge skaliert Bewertung, hat aber Positions-, Längen- und Selbstbevorzugung. Welcher Bewerter passt und wie man ein Modell kalibriert.
-
Betriebsreihe: SLOs für Agenten, von Aufgabenerfolg bis Zeit bis zur Freigabe
Ein SLO für AI agents wird wie für jeden Dienst definiert: Aufgabenerfolg, Konsistenz, Latenz, Kosten pro Aufgabe und ein Error Budget als Rollout-Steuerung.
-
Qualitätsschranken für Agenten-Ergebnisse: eine Prüfliste gegen Ausschuss
AI code quality gates lassen Maschinen aussortieren, was Menschen nie lesen sollten. Prüfliste vor dem Review: Tests, Evals, Größenlimits, Policy, Herkunft.
-
Agent-Evals 101: Aufgaben, Grader und Transkripte
KI-Agenten bewerten heißt, das Ergebnis in der Umgebung zu prüfen, nicht nur die Antwort. Aufgaben, Trials, Grader, Transkripte und pass@k gegen pass^k.