|
Getting your Trinity Audio player ready...
|
Eine Mehrheit der Unternehmen, die ihre KI-Agenten vorab testen, hat erlebt, dass ein Agent alle Prüfungen besteht und anschließend bei Kunden Fehler verursacht. Die Antwort der Praxis lautet: mehr Monitoring, mehr menschliche Prüfung, gestufte Freigaben nach Risikoklassen. Dieses Kontrollmodell funktioniert jedoch nur bei Agenten, die feste Regeln abarbeiten. Wo Regeln ausgelegt werden müssen, versagt es, und die Kontrolle zehrt den Produktivitätsgewinn auf. Ein Beitrag über die Lücke zwischen Evaluierung und institutioneller Einbettung.
Der Befund
Die Marktforschungseinheit des US-Fachmediums VentureBeat befragt seit einigen Monaten technische Führungskräfte zur Zuverlässigkeit von KI-Agenten. Die August-Welle zeigt eine deutliche Ernüchterung. Nur noch 56 Prozent der Unternehmen mit autonomen Agenten erlauben für risikoarme Fälle Produktionsänderungen ohne menschliche Prüfung oder wollen dies innerhalb eines Jahres ermöglichen; im Juli waren es 75 Prozent. Der Anteil derer, die menschliche Prüfung dauerhaft beibehalten wollen, stieg von 20 auf 42 Prozent.
Der Grund liegt nahe. Unter den Unternehmen, die vorab evaluieren, berichten 61 Prozent von mindestens einem Agenten oder einer LLM-Funktion, die alle internen Tests bestanden und danach einen kundenwirksamen Fehler verursacht hat; 22 Prozent haben das mehr als einmal erlebt. Als größte Schwäche automatisierter Evaluierungen nennen die Befragten am häufigsten die schlechte Übereinstimmung mit realen Nutzungsergebnissen (27 Prozent), gefolgt von fehlender Erklärbarkeit (24 Prozent). Nur 9 Prozent sehen keine wesentliche Vertrauensbarriere.
Ebenso aufschlussreich ist, was im laufenden Betrieb beobachtet wird. 53 Prozent setzen vorrangig auf Trace-Logging oder Gateway-Monitoring, also auf Latenz, Tokenverbrauch, Fehlerquoten und Kosten. Nur 29 Prozent prüfen die Ergebnisse ihrer Agenten in Echtzeit auf inhaltliche Korrektheit. Gleichzeitig nutzen 59 Prozent die nativen Evaluierungsfunktionen der OpenAI-Entwicklerplattform, im Juli waren es 31 Prozent, und 62 Prozent planen die Einführung einer neuen oder zusätzlichen Evaluierungsplattform. Als am stärksten wachsende Investition nennen 30 Prozent menschliche Prüfprozesse, 26 Prozent Observability und 21 Prozent automatisierte Evaluierungspipelines.
Die Datenbasis ist schmal. Die Studie beruht auf 140 Antworten selbstselektierter Leser und Panelteilnehmer aus Unternehmen mit mindestens 100 Beschäftigten, und Juli und August wurden mit unterschiedlichen Stichproben erhoben. Wie unruhig das Bild ist, zeigt eine frühere Welle derselben Reihe: Dort steuerten ausgerechnet die Unternehmen, die bereits Fehlschläge erlebt hatten, besonders häufig auf den Wegfall menschlicher Prüfung zu. Die Zahlen beschreiben daher Tendenzen und Stimmungen, keine gesicherten Verhältnisse. Gerade als Stimmungsbild lassen sie aber eine Frage schärfer hervortreten, die in der Debatte über agentische KI meist unterbelichtet bleibt.
Bestehen ist nicht Bewähren
Die Studie behandelt Zuverlässigkeit als Eigenschaft des Agenten, die sich durch Tests vor dem Einsatz und durch Beobachtung im Betrieb feststellen lässt. Ihr wichtigster Befund widerspricht dieser Annahme. Wenn eine Mehrheit erlebt, dass Agenten Tests bestehen und sich trotzdem nicht bewähren, liegt das Problem vermutlich nicht in fehlender Testabdeckung.
Eine Evaluierung prüft gegen eine Spezifikation. Ob ein Ergebnis richtig ist, entscheidet sich aber erst im institutionellen Zusammenhang, in dem es wirksam wird: in Vertragsbedingungen, Kundenerwartungen, Kulanzpraxis, eingespielten Zuständigkeiten und ungeschriebenen Regeln einer Abteilung. Die Testumgebung ist gerade der Ort, an dem dieser Zusammenhang fehlt. Ein Agent kann alle definierten Kriterien erfüllen und dennoch eine Antwort geben, die in der konkreten Kundenbeziehung falsch ist.
An dieser Stelle setzt das Konzept des institutionell situierten Agenten an. Es geht davon aus, dass die Zuverlässigkeit eines Agenten keine Eigenschaft ist, die er für sich besitzt, sondern sich aus seiner Einbettung in Regeln, Rollen, Zuständigkeiten und Eskalationswege ergibt. Die Lücke zwischen Bestehen und Bewähren ist demnach kein Messfehler, den bessere Werkzeuge schließen könnten. Sie ist ein Situiertheitsdefizit: Der Agent wird außerhalb des Zusammenhangs geprüft, in dem sein Handeln Bedeutung erhält.
Die Typenfrage
Das Kontrollmodell, das sich aus der Studie ergibt und das inzwischen viele Unternehmen verfolgen, ist einleuchtend. Vollautomatische Freigaben gibt es nur für klar abgegrenzte, risikoarme Änderungen; alles mit Kunden‑, Finanz‑, Sicherheits- oder Compliance-Bezug wird von Menschen geprüft. Das Modell setzt allerdings voraus, dass sich das Risiko einer Handlung vorab nach ihrem Typ bestimmen lässt.
Ob das gelingt, hängt davon ab, welche Art von Agent man vor sich hat. Drei Typen lassen sich unterscheiden. Regelgebundene Agenten handeln innerhalb eines festgelegten Regelraums; sie führen aus, was vorgegeben ist. Regelintelligente Agenten legen Regeln im Kontext aus; sie entscheiden, welche Regel in einer bestimmten Situation greift und wie sie anzuwenden ist. Regelentwerfende Agenten bilden selbst neue Regeln oder Konventionen, sei es ausdrücklich oder im Zusammenspiel mit anderen Agenten.
Für regel…
