Evals
Evaluations · Evaluierungen
Systematische Tests der Ausgaben eines KI-Systems gegen erwartete Ergebnisse, automatisch nach jeder Änderung ausgeführt.
01Kurz gesagt
Systematische Tests der Ausgaben eines KI-Systems gegen erwartete Ergebnisse, automatisch nach jeder Änderung ausgeführt.
In ProduktionKeine Evals, kein Go-live. Die Erfolgsquote ist das Freigabekriterium.
02Video
03Euer erstes Eval-Set in fünf Schritten
- Eine Aufgabe und eine Zahl wählen.Schreibt auf, was eine gute Antwort für einen Prozess bedeutet — „Schadenfall ans richtige Team geroutet“, nicht „die KI ist gut“. Eine Aufgabe, eine Metrik.
- Echte Fälle sammeln.Zieht ein paar hundert echte Eingaben aus dem Prozess, auch die hässlichen: Tippfehler, Grenzfälle, die Fälle, über die sich Leute streiten.
- Das erwartete Ergebnis labeln.Lasst die Leute, die die Arbeit heute machen, die richtige Antwort markieren. Wo sie sich uneinig sind, habt ihr eine Grundsatzfrage gefunden, keine KI-Frage.
- Die Bewertung automatisieren.Exakter Abgleich, wo es geht, Regeln, wo sie passen, LLM-as-a-Judge mit schriftlichem Bewertungsschema, wo es sein muss — und prüft den Judge per Stichprobe.
- Bei jeder Änderung laufen lassen.Neuer Prompt, neue Modellversion, neue Retrieval-Einstellung: Das Eval läuft in der CI, und die Erfolgsquote entscheidet über den Weg in die Produktion.
04Checkliste
05FAQ
Wie viele Fälle brauchen wir?
Genug, um die Vielfalt eures Prozesses abzudecken. Ein paar hundert echte Fälle schlagen meist Tausende synthetische.
Können wir stattdessen einen öffentlichen Benchmark nehmen?
Für die Vorauswahl von Modellen, ja. Als Beweis, dass das System in eurem Prozess funktioniert, nein — Benchmarks kennen eure Schadenfälle, Verträge und Kunden nicht.
Wem gehört das Eval-Set?
Dem Prozess-Owner. Nicht dem Anbieter und nicht dem KI-Team allein — sie bauen es gemeinsam, der Owner gibt den Schwellenwert frei.
Aus dem Magazin
06Verwandte Begriffe
Hier helfen wir · Secure