Getting your Trinity Audio player ready...

Eine Mehrheit der Unternehmen, die ihre KI-Agen­ten vor­ab testen, hat erlebt, dass ein Agent alle Prü­fun­gen beste­ht und anschließend bei Kun­den Fehler verur­sacht. Die Antwort der Prax­is lautet: mehr Mon­i­tor­ing, mehr men­schliche Prü­fung, gestufte Freiga­ben nach Risikok­lassen. Dieses Kon­trollmod­ell funk­tion­iert jedoch nur bei Agen­ten, die feste Regeln abar­beit­en. Wo Regeln aus­gelegt wer­den müssen, ver­sagt es, und die Kon­trolle zehrt den Pro­duk­tiv­itäts­gewinn auf. Ein Beitrag über die Lücke zwis­chen Evaluierung und insti­tu­tioneller Ein­bet­tung.


Der Befund

Die Mark­t­forschung­sein­heit des US-Fachmedi­ums Ven­ture­Beat befragt seit eini­gen Monat­en tech­nis­che Führungskräfte zur Zuver­läs­sigkeit von KI-Agen­ten. Die August-Welle zeigt eine deut­liche Ernüchterung. Nur noch 56 Prozent der Unternehmen mit autonomen Agen­ten erlauben für risikoarme Fälle Pro­duk­tion­sän­derun­gen ohne men­schliche Prü­fung oder wollen dies inner­halb eines Jahres ermöglichen; im Juli waren es 75 Prozent. Der Anteil der­er, die men­schliche Prü­fung dauer­haft beibehal­ten wollen, stieg von 20 auf 42 Prozent.

Der Grund liegt nahe. Unter den Unternehmen, die vor­ab evaluieren, bericht­en 61 Prozent von min­destens einem Agen­ten oder ein­er LLM-Funk­tion, die alle inter­nen Tests bestanden und danach einen kun­den­wirk­samen Fehler verur­sacht hat; 22 Prozent haben das mehr als ein­mal erlebt. Als größte Schwäche automa­tisiert­er Evaluierun­gen nen­nen die Befragten am häu­fig­sten die schlechte Übere­in­stim­mung mit realen Nutzungsergeb­nis­sen (27 Prozent), gefol­gt von fehlen­der Erk­lär­barkeit (24 Prozent). Nur 9 Prozent sehen keine wesentliche Ver­trauens­bar­riere.

Eben­so auf­schlussre­ich ist, was im laufend­en Betrieb beobachtet wird. 53 Prozent set­zen vor­rangig auf Trace-Log­ging oder Gate­way-Mon­i­tor­ing, also auf Latenz, Token­ver­brauch, Fehlerquoten und Kosten. Nur 29 Prozent prüfen die Ergeb­nisse ihrer Agen­ten in Echtzeit auf inhaltliche Kor­rek­theit. Gle­ichzeit­ig nutzen 59 Prozent die nativ­en Evaluierungs­funk­tio­nen der Ope­nAI-Entwick­ler­plat­tform, im Juli waren es 31 Prozent, und 62 Prozent pla­nen die Ein­führung ein­er neuen oder zusät­zlichen Evaluierungsplat­tform. Als am stärk­sten wach­sende Investi­tion nen­nen 30 Prozent men­schliche Prüf­prozesse, 26 Prozent Observ­abil­i­ty und 21 Prozent automa­tisierte Evaluierungspipelines.

Die Daten­ba­sis ist schmal. Die Studie beruht auf 140 Antworten selb­st­se­lek­tiert­er Leser und Pan­el­teil­nehmer aus Unternehmen mit min­destens 100 Beschäftigten, und Juli und August wur­den mit unter­schiedlichen Stich­proben erhoben. Wie unruhig das Bild ist, zeigt eine frühere Welle der­sel­ben Rei­he: Dort steuerten aus­gerech­net die Unternehmen, die bere­its Fehlschläge erlebt hat­ten, beson­ders häu­fig auf den Weg­fall men­schlich­er Prü­fung zu. Die Zahlen beschreiben daher Ten­den­zen und Stim­mungen, keine gesicherten Ver­hält­nisse. Ger­ade als Stim­mungs­bild lassen sie aber eine Frage schär­fer her­vortreten, die in der Debat­te über agen­tis­che KI meist unter­be­lichtet bleibt.

Bestehen ist nicht Bewähren

Die Studie behan­delt Zuver­läs­sigkeit als Eigen­schaft des Agen­ten, die sich durch Tests vor dem Ein­satz und durch Beobach­tung im Betrieb fest­stellen lässt. Ihr wichtig­ster Befund wider­spricht dieser Annahme. Wenn eine Mehrheit erlebt, dass Agen­ten Tests beste­hen und sich trotz­dem nicht bewähren, liegt das Prob­lem ver­mut­lich nicht in fehlen­der Testab­deck­ung.

Eine Evaluierung prüft gegen eine Spez­i­fika­tion. Ob ein Ergeb­nis richtig ist, entschei­det sich aber erst im insti­tu­tionellen Zusam­men­hang, in dem es wirk­sam wird: in Ver­trags­be­din­gun­gen, Kun­den­er­wartun­gen, Kulanzprax­is, einge­spiel­ten Zuständigkeit­en und ungeschriebe­nen Regeln ein­er Abteilung. Die Tes­tumge­bung ist ger­ade der Ort, an dem dieser Zusam­men­hang fehlt. Ein Agent kann alle definierten Kri­te­rien erfüllen und den­noch eine Antwort geben, die in der konkreten Kun­den­beziehung falsch ist.

An dieser Stelle set­zt das Konzept des insti­tu­tionell situ­ierten Agen­ten an. Es geht davon aus, dass die Zuver­läs­sigkeit eines Agen­ten keine Eigen­schaft ist, die er für sich besitzt, son­dern sich aus sein­er Ein­bet­tung in Regeln, Rollen, Zuständigkeit­en und Eskala­tion­swege ergibt. Die Lücke zwis­chen Beste­hen und Bewähren ist dem­nach kein Mess­fehler, den bessere Werkzeuge schließen kön­nten. Sie ist ein Situ­iertheits­de­fiz­it: Der Agent wird außer­halb des Zusam­men­hangs geprüft, in dem sein Han­deln Bedeu­tung erhält.

Die Typenfrage

Das Kon­trollmod­ell, das sich aus der Studie ergibt und das inzwis­chen viele Unternehmen ver­fol­gen, ist ein­leuch­t­end. Vol­lau­toma­tis­che Freiga­ben gibt es nur für klar abge­gren­zte, risikoarme Änderun­gen; alles mit Kunden‑, Finanz‑, Sicher­heits- oder Com­pli­ance-Bezug wird von Men­schen geprüft. Das Mod­ell set­zt allerd­ings voraus, dass sich das Risiko ein­er Hand­lung vor­ab nach ihrem Typ bes­tim­men lässt.

Ob das gelingt, hängt davon ab, welche Art von Agent man vor sich hat. Drei Typen lassen sich unter­schei­den. Regel­ge­bun­dene Agen­ten han­deln inner­halb eines fest­gelegten Regel­raums; sie führen aus, was vorgegeben ist. Regelin­tel­li­gente Agen­ten leg­en Regeln im Kon­text aus; sie entschei­den, welche Regel in ein­er bes­timmten Sit­u­a­tion greift und wie sie anzuwen­den ist. Rege­len­twer­fende Agen­ten bilden selb­st neue Regeln oder Kon­ven­tio­nen, sei es aus­drück­lich oder im Zusam­men­spiel mit anderen Agen­ten.

Für regel…

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert