Ist Ihr KI-System sechs Monate später noch korrekt? Niemand weiß es, solange es niemand gemessen hat
Ein automatisierter Workflow geht live. Im ersten Monat beobachten ihn alle. Im dritten sind die Menschen, die früher die Arbeit gemacht haben, mit anderen Aufgaben beschäftigt, der Anbieter ist bei anderen Kunden, und das System liefert Ergebnisse, die niemand prüft, weil es nicht offensichtlich kaputt ist. Im sechsten Monat hat sich die Preisliste für Kunden geändert, ein Lieferant schickt Rechnungen in einem neuen Format, und das Modell, das bei den Fällen, für die es gebaut wurde, genau war, liegt bei einem Fünftel der Fälle, die es jetzt sieht, still und leise falsch. Nichts ist ausgefallen. Nichts hat Alarm geschlagen. Das System läuft weiter, und es ist nicht mehr korrekt.
Dieser Artikel erklärt für einen COO oder eine Leitung Operations, nicht für Entwickler, was eine Evaluationssuite ist, warum sie die einzige ehrliche Antwort auf die Frage „Arbeitet es noch korrekt?“ ist und was Sie einfordern sollten, damit es diese Antwort in sechs Monaten auch gibt. Er geht davon aus, dass der größte Teil eines Workflows überhaupt keine KI sein sollte und dass der Teil, der es ist, dauerhaft eine Zahl braucht.
Das Wichtigste in Kürze
- Eine Evaluationssuite ist ein Golden Dataset plus ein monatlicher Bericht. Fälle, die Ihr eigenes Team korrekt bearbeitet hat, Schritt für Schritt bewertet und jeden Monat erneut gegen das produktive System laufen gelassen.
- Vertrauen ist das falsche Instrument. Die Menschen, die diese Systeme bauen, misstrauen ihnen mehr, als sie ihnen vertrauen: 46 % der Entwickler misstrauen der Genauigkeit von KI-Tools aktiv, gegenüber 33 %, die ihr vertrauen (Stack Overflow, 2025). Ein COO, der einem solchen System im Produktivbetrieb vertrauen soll, hat Anspruch auf eine Zahl.
- Bewerten Sie die Schritte, die ein Modell brauchen, nicht das ganze System. Die meisten Schritte sind Abfragen und Regeln. In der Auftragsabwicklung eines europäischen Herstellers benötigten drei von elf Schritten ein Modell (SUPALABS-Projektdaten, 2024–2026). Diese drei bekommen das Golden Dataset.
- Kaufen Sie sie als eigene Position. Eine eingerechnete Evaluation wird als Erstes gestrichen, wenn die Umsetzung in Verzug gerät. Separat angeboten, bleibt sie erhalten.
Was „noch korrekt“ im operativen Sinn bedeutet
Ein Workflow arbeitet korrekt, wenn er bei den Fällen, die tatsächlich eingehen, das Ergebnis liefert, das die Person geliefert hätte, die die Arbeit früher gemacht hat. Beide Hälften zählen. „Das Ergebnis, das die Person geliefert hätte“ bedeutet, dass der Maßstab das Urteil Ihres eigenen Teams ist und kein Benchmark, den der Anbieter ausgewählt hat. „Bei den Fällen, die tatsächlich eingehen“ bedeutet, dass der Maßstab die Ausnahmen einschließen muss – den Kunden, der Bestellungen als Foto schickt, die Rechnung mit einer Bestellnummer, die es nicht gibt –, denn genau dort beginnt ein System zuerst zu driften.
Drift hat drei gewöhnliche Ursachen, keine davon dramatisch. Die Umwelt ändert sich: eine Preisliste, das Dokumentformat eines Lieferanten, eine Vorschrift, der Kundenmix. Das System ändert sich: Der Anbieter aktualisiert eine Modellversion, ein Konnektor wird gepatcht, eine Regel wird angepasst, um einen Fall zu beheben, und bricht still einen anderen. Und die Menschen ändern sich: Die Mitarbeiterin, die falsche Ergebnisse früher auf den ersten Blick erkannt hat, wurde befördert, und ihr Nachfolger weiß nicht, wie „falsch“ aussieht. Ein System, das sechs Monate lang allen drei Faktoren ohne Messung ausgesetzt war, ist nicht „wahrscheinlich in Ordnung“. Es ist ungemessen.
Was eine Evaluationssuite ist
Eine Evaluationssuite besteht aus zwei Teilen, und beide sind so gewöhnlich, dass ein COO sie ohne Entwickler spezifizieren kann.
Der erste Teil ist ein Golden Dataset: eine Sammlung realer Fälle aus Ihrer eigenen Historie – Aufträge, Rechnungen, Schadensmeldungen, Entwürfe –, jeweils zusammen mit dem Ergebnis, das Ihr Team erstellt und freigegeben hat. Keine synthetischen Beispiele. Nicht die Demodaten des Anbieters. Ihre Fälle, einschließlich der unbequemen, so ausgewählt, dass die Sammlung die Ausnahmen aus dem Ausnahmeregister abdeckt und nicht nur den Normalfall. Ein paar hundert Fälle reichen für einen Workflow meist aus; wichtiger als die Zahl ist, dass die Ausnahmen im Verhältnis zu ihrer tatsächlichen Häufigkeit vertreten sind.
Der zweite Teil ist eine Erfolgsquote pro Schritt. Der Workflow wird nicht als Ganzes bewertet, sondern Schritt für Schritt, und nur bei den Schritten, die ein Urteil enthalten. Eine Abfrage muss nicht bewertet werden; sie ist entweder korrekt implementiert oder nicht. Ein Schritt, in dem ein Modell das PDF eines Lieferanten liest und entscheidet, welcher Katalognummer es entspricht, muss es sehr wohl. Im Workflow zur Auftragsabwicklung eines europäischen Herstellers, den SUPALABS kartiert hat, benötigten drei von elf Schritten tatsächlich ein Modell, und die übrigen acht waren Parsing, Abfragen, Validierung und Routing (SUPALABS-Projektdaten, 2024–2026). Das Golden Dataset bewertet diese drei. Die übrigen acht werden einmal getestet, wie jede andere Software, und dann in Ruhe gelassen.
Setzen Sie beide Teile zusammen und lassen Sie sie jeden Monat gegen das produktive System laufen, und Sie haben einen monatlichen Genauigkeitsbericht: für jeden Urteilsschritt der Anteil der Golden-Dataset-Fälle, die das System in diesem Monat richtig bearbeitet hat, verglichen mit dem Vormonat und mit dem Schwellenwert, den Sie festgelegt haben. Dieser Bericht ist die Antwort auf die Frage „Arbeitet es noch korrekt?“. Er umfasst eine Seite. Das System schreibt ihn über sich selbst, und das macht ihn zum einzigen Testimonial, das etwas wert ist.
Was ein monatlicher Genauigkeitsbericht enthält
| Zeile | Was sie einem COO sagt |
| Erfolgsquote pro Urteilsschritt, dieser Monat im Vergleich zum Vormonat | Ob ein Schritt driftet, und welcher |
| Erfolgsquote im Vergleich zu Ihrem Schwellenwert | Ob der Schritt seine aktuelle Befugnisstufe behält oder zurückgestuft wird |
| In diesem Monat hinzugefügte Golden-Dataset-Fälle | Ob das Dataset noch die Fälle abbildet, die tatsächlich eingehen |
| Ausgelöste Regressionswarnungen und was sich geändert hat | Welche der drei Ursachen für die Drift verantwortlich war |
| Kosten pro Durchlauf, dieser Monat im Vergleich zum Vormonat | Ob ein günstigeres Modell einen Schritt mit derselben Erfolgsquote erledigen könnte |
Warum Vertrauen das falsche Instrument ist
Die Alternative zur Messung ist Vertrauen, und das Vertrauen in KI-Ergebnisse entwickelt sich in die falsche Richtung, während die Nutzung steigt. Die Stack Overflow Developer Survey 2025 ergab, dass 84 % der Entwickler KI-Tools nutzen oder dies planen, und in derselben Umfrage gaben 46 % an, der Genauigkeit dieser Tools aktiv zu misstrauen, gegenüber 33 %, die ihr vertrauen. Das sind die Menschen, die diese Systeme beruflich bauen und am nächsten dran sind, wenn sie versagen. Wenn sie sich nicht auf Vertrauen verlassen, sollte man das auch von einer Leitung Operations nicht verlangen, die für die Ergebnisse einer Warteschlange für Lieferantenrechnungen verantwortlich ist.
Deshalb ist die Zusicherung eines Anbieters beim Launch auch kein Beleg. Ein Genauigkeitswert zum Launch ist eine Messung an dem Tag, an dem die Umwelt, das System und die Menschen noch so waren, wie der Anbieter sie verlassen hat. Der monatliche Bericht ist dieselbe Messung, nachdem sich alle drei verändert haben. Die erste zeigt Ihnen, dass das System funktioniert hat. Die zweite zeigt Ihnen, dass es funktioniert.
Wie der Bericht die Befugnisse steuert
Die Evaluationssuite ist nicht nur ein Monitor. Sie ist der Mechanismus, über den sich eine automatisierte Aufgabe das Recht zu handeln verdient. Jede Aufgabe beginnt auf der Stufe „Entwurf“: Das System bereitet die Arbeit vor, ein Mensch stellt sie fertig, und das Golden Dataset bewertet die Entwürfe. Wenn die von Ihnen als Schwellenwert definierte Erfolgsquote an realen Fällen erreicht ist, steigt die Aufgabe auf die Stufe „Freigegeben“: Das System bereitet die vollständige Aktion vor, und eine namentlich benannte Person genehmigt sie. Nur bei umkehrbaren Schritten, und nur wenn die Erfolgsquote stabil bleibt, steigt eine Aufgabe auf die Stufe „Autonom“, auf der sie selbst handelt und das Team im Nachhinein prüft. Eine Regression im monatlichen Bericht stuft die Aufgabe um eine Stufe zurück, bis die Erfolgsquote wieder erreicht ist. Unumkehrbare Schritte – alles, was Meldungen an eine Behörde abgibt, Waren versendet oder Geld bewegt – bleiben unabhängig von der Genauigkeit auf der Stufe „Freigegeben“, denn ein umkehrbarer Fehler ist ein Kostenfaktor, ein unumkehrbarer ein Haftungsrisiko.
Die Schwellenwerte gehören Ihnen. Nichts wird hochgestuft, nur weil der Anbieter es sagt. Das ist der Unterschied zwischen „Human in the Loop“ als Slogan und als Zahl, und er ist auf der Methodenseite vollständig beschrieben.
Was Sie vor der Umsetzung einfordern sollten
Vier Dinge, alle in einem Angebot oder einer Leistungsbeschreibung überprüfbar.
- Die Evaluationssuite als eigene Position. Nicht in die Umsetzung eingerechnet. Eine eingerechnete Evaluation wird als Erstes gestrichen, wenn die Umsetzung in Verzug gerät, und irgendwo gerät die Umsetzung immer in Verzug. Separat angeboten, übersteht sie den Zeitplan.
- Ein Golden Dataset aus Ihren Fällen, das die Ausnahmen abdeckt. Fragen Sie, wie die Fälle ausgewählt werden und ob das Ausnahmeregister die Auswahl bestimmt. Ein Dataset aus sauberen Fällen meldet genau an dem Tag noch eine hohe Erfolgsquote, an dem sie nicht mehr stimmt.
- Bewertung pro Schritt, nur bei den Urteilsschritten. Fragen Sie, welche Schritte bewertet werden und warum. Die Antwort sollte eine kurze Liste sein, und sie sollte mit der KI-Grenzkarte übereinstimmen. Ein Partner, der vorschlägt, „das System“ zu bewerten, hat die Schritte nicht eingeordnet.
- Den monatlichen Bericht, mit einem namentlich benannten Empfänger, der auch nach dem Weggang des Partners weiterläuft. Fragen Sie, wer ihn erhält, was passiert, wenn eine Zeile den Schwellenwert überschreitet, und ob das Golden Dataset bei Ihnen bleibt, wenn der Service endet. Die richtige Antwort auf die letzte Frage lautet Ja: Das System läuft in Ihren Accounts, das Dataset gehört Ihnen, und das Einzige, was endet, ist der Bericht.
Der Sechs-Monats-Test
Hier ist der gesamte Artikel als eine Frage, die Sie jedem Anbieter stellen können, oder Ihrem eigenen Team zu einem System, das bereits live ist. In sechs Monaten, an einem Dienstag, erzeugt die Warteschlange für Lieferantenrechnungen eine falsche Zuordnung, die niemand bemerkt, weil sie aussieht wie alle anderen. Was in Ihrem aktuellen Setup hätte Ihnen das an diesem Morgen gesagt? Lautet die Antwort „eine Person, die zufällig aufpasst“, verlassen Sie sich auf Vertrauen. Lautet sie „eine Zeile in einem monatlichen Bericht, die einen von Ihnen festgelegten Schwellenwert überschritten hat“, verlassen Sie sich auf Messung. Nur eines von beiden übersteht die Beförderung dieser Person. Die Evaluationssuite ist nicht der teure Teil eines KI-Workflows. Sie ist der Teil, der den Rest erst wertvoll macht, und was ein Partner sonst noch übergeben sollte, beschreiben wir in die fünf Dokumente, die Sie einfordern sollten.
Eine Zahl statt einer Zusicherung
Jede Umsetzung von SUPALABS wird mit einer Evaluationssuite als eigener Position im Angebot geliefert, mit einem Golden Dataset aus Ihren Fällen und einem monatlichen Genauigkeitsbericht, der weiterläuft, nachdem wir gegangen sind.
So läuft ein Projekt ab →Quellen & Referenzen
- Stack Overflow, „2025 Developer Survey: AI“, Quelle der Nutzungsquote von 84 % sowie der Werte von 46 % Misstrauen gegenüber 33 % Vertrauen in die Genauigkeit von KI-Ergebnissen.
- SUPALABS-Projektdaten, 2024–2026: drei von elf Schritten, die in der Auftragsabwicklung eines europäischen Herstellers ein Modell benötigten. Pro Projekt anonymisiert; kein Kunde wird genannt. Mit Quellen veröffentlicht unter /en/work/.
Wichtige Statistiken (2025)
Weiterführende Lektüre
Häufig gestellte Fragen
Innovation9 min2026-09-09

