Begriff
Evals
Evals sind systematische Tests für LLM-Anwendungen — feste Testfälle, automatische Bewertung der Antworten, Ergebnis als Score. Grundlage, um Prompt- oder Modellwechsel objektiv zu vergleichen.
Evals — ausführlicher erklärt
Wer eine LLM-Anwendung entwickelt, kennt das Problem: Eine kleine Prompt-Änderung verbessert ein Beispiel und verschlechtert drei andere — ohne Testabdeckung bleibt das unsichtbar. Evals lösen das, indem sie eine kuratierte Menge von Eingabe-Erwartung-Paaren gegen das System laufen lassen und jede Antwort bewerten. Die Bewertung kann deterministisch sein (exakter Match, regulärer Ausdruck), strukturell (JSON-Schema gültig?), per LLM-as-a-Judge (anderes Modell beurteilt) oder hybrid. Aus den Einzelbewertungen entsteht ein aggregierter Score, der über Builds verglichen wird.
Beispiel / Praxisbezug
OpenAI Evals, Promptfoo, Langfuse, Braintrust und LangSmith bieten Frameworks dafür; Anthropic stellt mit anthropic-evals und der Workbench eigene Werkzeuge bereit. Ein typischer Datensatz für einen Support-Bot: 50–500 Beispiel-Tickets mit erwarteten Tags, Tonality-Kriterien und Eskalations-Flags. CI-Pipelines können Eval-Suites bei jedem Pull Request ausführen und einen Merge bei Score-Regression blockieren.
Abgrenzung zu ähnlichen Begriffen
Public Benchmarks wie MMLU, HumanEval oder Terminal-Bench bewerten allgemeine Modellfähigkeiten — Evals dagegen prüfen die konkrete Anwendung mit ihrem eigenen Prompt-Stack. Unit Tests bewerten deterministisch eine Funktion; Evals akzeptieren Streuung in der Antwort und messen statistisch über viele Beispiele. Observability-Tools sammeln Live-Daten, die als Quelle für Eval-Datasets dienen.
Entdecke mehr
KI-Workflows per Keyword: Wie wir wiederkehrende Abläufe erzwingbar machen
Ein getipptes Keyword löst bei uns einen festen KI-Ablauf aus — und jeder Schritt muss committet werden, bevor der nächste kommt. Warum das der Trick ist.
GlossarGround Truth
Eine als korrekt geltende Referenz-Wahrheit, gegen die man Modell-Outputs misst. In der KI-Code-Analyse ist es ein Code-Stück mit gezielt eingebauten, bekannten Fehlern, sodass messbar wird, wie viel ein Modell wirklich findet.
LexikonAgent-Evaluation — Task-Success-Rate, Eval-Harness, Benchmarks
Wie man KI-Agenten bewertet: Eval-Harness, Task-Success-Rate, Benchmarks wie GAIA und Tau-Bench, LLM-as-a-Judge — und die Abgrenzung zur reinen Modell-Qualität.