Beiträge zu "quality"
-
Prompt-Hygiene: eine Prüfliste für Teams, die in Prompts ertrinken
Prompt management für Teams: eine Prüfliste zu Verantwortlichen, Version, Eval, Geltungsbereich und Review, plus die Regel: Wiederholtes in Skills.
-
LLM als Richter: nützlicher Bewerter mit bekannten Verzerrungen
LLM as a Judge skaliert Bewertung, hat aber Positions-, Längen- und Selbstbevorzugung. Welcher Bewerter passt und wie man ein Modell kalibriert.
-
Qualitätsschranken für Agenten-Ergebnisse: eine Prüfliste gegen Ausschuss
AI code quality gates lassen Maschinen aussortieren, was Menschen nie lesen sollten. Prüfliste vor dem Review: Tests, Evals, Größenlimits, Policy, Herkunft.
-
Kleine geprüfte Schritte schlagen einen großen Prompt
Inkrementelle Agent-Workflows zerlegen Arbeit in kleine Schritte mit Abnahmeprüfung, Fortschrittsnotiz und sauberem Zustand. Das Muster im Überblick.
-
Agent-Evals 101: Aufgaben, Grader und Transkripte
KI-Agenten bewerten heißt, das Ergebnis in der Umgebung zu prüfen, nicht nur die Antwort. Aufgaben, Trials, Grader, Transkripte und pass@k gegen pass^k.
-
Zu viele Prompts: wie Prompt-Wildwuchs zu KI-Ausschuss wird
AI Slop ist Ausgabe, die schneller wächst, als jemand sie prüfen kann. Wie Prompt-Wildwuchs die Qualität senkt und warum kleine, geprüfte Schritte besser sind.