Ein KI-Agent, der in der Vorführung überzeugt, ist noch lange nicht produktionsreif. Der Unterschied zwischen einem gelungenen Einzelbeispiel und einem verlässlichen Werkzeug liegt im systematischen Testen. Anders als bei klassischer Software gibt ein Agent auf dieselbe Eingabe nicht immer exakt dieselbe Antwort, deshalb reicht ein einmaliges Durchklicken nicht. Dieser Ratgeber erklärt, wie Sie einen KI-Agenten vor dem Go-Live seriös prüfen, ohne dafür ein ganzes Testlabor aufzubauen.
Warum sich KI-Agenten anders testen lassen als normale Software
Klassische Software ist deterministisch: Gleiche Eingabe, gleiches Ergebnis. Ein KI-Agent arbeitet mit Wahrscheinlichkeiten und kann bei derselben Frage in Formulierung und Weg leicht variieren. Das hat zwei Konsequenzen. Erstens genügt es nicht, einen Fall einmal zu testen, man muss prüfen, ob das Ergebnis über viele ähnliche Fälle hinweg stabil bleibt. Zweitens gibt es oft nicht die eine richtige Antwort, sondern einen Bereich akzeptabler Antworten. Das Testen verschiebt sich damit von „richtig oder falsch” hin zu „gut genug und sicher”. Wer verstehen will, warum diese Unschärfe entsteht, findet die Grundlagen im Beitrag Wie funktioniert ein Sprachmodell?.
Das Fundament: ein Satz fester Testfälle
Der wichtigste und zugleich am meisten unterschätzte Schritt ist eine Sammlung echter, repräsentativer Testfälle, oft „Goldstandard” genannt. Das ist eine Liste von Eingaben mit der jeweils erwarteten, von Menschen geprüften Musterantwort. Gute Quellen dafür sind echte vergangene Vorgänge: alte E-Mails, reale Belege, tatsächlich gestellte Kundenfragen. Wichtig ist die Mischung:
- Normalfälle: die häufigen, alltäglichen Vorgänge, die den Großteil der Arbeit ausmachen.
- Randfälle: ungewöhnliche, aber legitime Fälle, etwa eine unvollständige Rechnung oder eine mehrdeutige Anfrage.
- Fallen: Fälle, in denen der Agent bewusst nichts tun oder abbrechen und an einen Menschen übergeben sollte.
Schon 30 bis 50 gut ausgewählte Fälle liefern ein deutlich belastbareres Bild als hundert zufällige Klicks. Diese Sammlung ist keine Einmalarbeit: Jeder im Betrieb aufgetretene Fehler wandert als neuer Testfall hinein und schützt künftig vor demselben Fehler.
Woran man Qualität misst
Nicht jede Aufgabe wird gleich bewertet. Je nach Einsatz zählen andere Maßstäbe:
- Korrektheit: Stimmt das Ergebnis sachlich? Bei Datenextraktion etwa: Wurde der Betrag richtig ausgelesen?
- Vollständigkeit: Hat der Agent alles Nötige erfasst, nichts Wichtiges ausgelassen?
- Sicheres Nichtstun: Erkennt der Agent Fälle, die er nicht bearbeiten sollte, und übergibt er sie korrekt? Dieser Punkt wird oft vergessen und ist einer der wichtigsten.
- Keine Erfindungen: Stützt sich die Antwort auf die vorhandenen Daten, statt Fakten zu erfinden? Der Umgang damit ist Thema im Beitrag Halluzinationen und Guardrails.
Für jeden Maßstab lohnt es, vorab eine Zielmarke festzulegen, etwa: „In mindestens 95 Prozent der Normalfälle korrekt, und in keinem einzigen Fall eine erfundene Angabe.” Erst wenn diese Marken erreicht sind, ist der Agent startbereit.
Der Mensch als Prüfinstanz
Ein Teil der Bewertung lässt sich automatisieren, etwa der Abgleich ausgelesener Zahlen mit einer Sollwert-Liste. Bei Texten und Einschätzungen führt aber kein Weg an menschlicher Beurteilung vorbei, zumindest bei den ersten Durchläufen und in Stichproben. Praktisch bewährt hat sich ein einfaches Vorgehen: Eine fachkundige Person bewertet die Antworten des Agenten anhand einer kurzen, immer gleichen Checkliste. So werden Urteile vergleichbar, statt vom Tagesgefühl abzuhängen. Diese menschliche Prüfung ist kein Misstrauensvotum, sondern der Kern verantwortungsvoller Einführung, eng verwandt mit dem Prinzip Mensch-in-the-Loop im laufenden Betrieb.
Testen hört nach dem Start nicht auf
Der Go-Live ist kein Schlussstrich, sondern ein Übergang. Zwei Testarten begleiten den Betrieb dauerhaft. Erstens der Regressionstest: Bevor irgendetwas geändert wird, ein neuer Textbaustein, ein Modellwechsel, eine angepasste Anweisung, lässt man den festen Testfall-Satz erneut durchlaufen und prüft, ob sich nichts verschlechtert hat. Zweitens die laufende Stichprobe: Ein kleiner Anteil der echten Vorgänge wird regelmäßig von Menschen nachkontrolliert, um schleichende Verschlechterung früh zu bemerken. Wie sich das dauerhaft organisieren lässt, beschreibt der Ratgeber Monitoring und Observability. Erst dieses Zusammenspiel aus Test vor dem Start und Überwachung danach macht einen Agenten wirklich verlässlich.
Häufige Fragen
Warum kann man einen KI-Agenten nicht wie normale Software testen?
Weil ein KI-Agent nicht deterministisch arbeitet: Auf dieselbe Eingabe kann er in Formulierung und Weg leicht unterschiedliche Antworten geben. Deshalb reicht es nicht, einen Fall einmal zu prüfen, man muss testen, ob das Ergebnis über viele ähnliche Fälle hinweg stabil und sicher bleibt. Außerdem gibt es oft nicht die eine richtige Antwort, sondern einen Bereich akzeptabler Antworten. Das Testen verschiebt sich damit von einem einfachen „richtig oder falsch” zu „gut genug und sicher”.
Was ist ein Goldstandard beim Testen von KI-Agenten?
Ein Goldstandard ist eine Sammlung repräsentativer Testfälle mit jeweils erwarteter, von Menschen geprüfter Musterantwort. Gute Quellen sind echte vergangene Vorgänge wie alte E-Mails, reale Belege oder tatsächlich gestellte Kundenfragen. Die Sammlung sollte Normalfälle, Randfälle und bewusste Fallen enthalten, bei denen der Agent nichts tun und an einen Menschen übergeben sollte. Schon 30 bis 50 gut gewählte Fälle liefern ein belastbares Bild.
Welche Kriterien sind beim Testen wichtig?
Je nach Aufgabe zählen Korrektheit, Vollständigkeit, das sichere Erkennen von Fällen, die der Agent nicht bearbeiten sollte, und das Vermeiden erfundener Angaben. Für jedes Kriterium sollte vorab eine Zielmarke feststehen, etwa eine Mindestquote korrekter Normalfälle und die klare Vorgabe, dass keine Fakten erfunden werden. Erst wenn diese Marken erreicht sind, ist der Agent startbereit.
Ist das Testen mit dem Go-Live abgeschlossen?
Nein. Zwei Testarten begleiten den Betrieb dauerhaft: der Regressionstest, bei dem vor jeder Änderung der feste Testfall-Satz erneut durchläuft, um Verschlechterungen auszuschließen, und die laufende Stichprobe, bei der ein kleiner Anteil echter Vorgänge regelmäßig von Menschen nachkontrolliert wird. Erst das Zusammenspiel aus Test vor dem Start und Überwachung danach macht einen Agenten verlässlich.