Getting your Trinity Audio player ready...

Ein Ven­ture­Beat-Gast­beitrag zeigt, wie sich die Zusam­me­nar­beit mehrerer KI-Agen­ten messen und mit deter­min­is­tis­chen Kon­trollen absich­ern lässt. Das überzeugt, solange Agen­ten Regeln befol­gen. Ob es auch trägt, wenn sie Regeln selb­st entwer­fen, bleibt offen.


Shuhua Xu, Lead Data Engi­neer, veröf­fentlicht am 10. Okto­ber 2026 bei Ven­ture­Beat den Gast­beitrag „AI agents can be unpre­dictable. Your con­trol lay­er should­n’t be”. Seine These: In Mul­ti-Agen­ten-Sys­te­men kön­nen alle Agen­ten einzeln kor­rekt arbeit­en und gemein­sam den­noch ein falsches Ergeb­nis liefern. Der Fehler sitzt zwis­chen den Agen­ten, in der Über­gabe, im geteil­ten Zus­tand, in Schleifen und darin, dass mehrere Agen­ten auf das­selbe Basis­mod­ell zurück­greifen und dessen Fehler gegen­seit­ig bestäti­gen.

Was der Beitrag vorschlägt

Xu überträgt die Evaluierung von RAG-Sys­te­men auf die Agen­ten-Zusam­me­nar­beit. Zuerst wird der gesamte Ablauf pro­tokol­liert. Darauf bauen vier Prüfebe­nen auf:

  • Ablauf: Dead­locks, Live­locks und Abbruchrat­en gel­ten als Eigen­schaften des Aus­führungs­graphen, nicht einzel­ner Agen­ten.
  • Über­gaben: Geprüft wer­den Kon­tex­tqual­ität, Inter­pre­ta­tion durch den nachge­lagerten Agen­ten und die Schnittstelle, also struk­turi­erte Verträge in Form von JSON-Schemas.
  • Geteil­ter Zus­tand: Ein „State Man­ag­er” prüft jeden Zus­tand­süber­gang, etwa auf unverän­der­liche Felder, Kon­sis­tenz und Aktu­al­ität, ergänzt um seman­tis­che Prü­fun­gen durch ein Sprach­mod­ell.
  • Mod­ell-Monokul­tur: Gemessen wird, ob Agen­ten tat­säch­lich unab­hängig urteilen. Als wichtig­ste Kenn­zahl gilt die Fehlerko­r­re­la­tion.

Daraus fol­gen tech­nis­che Kon­trollen: Höch­stzahl an Iter­a­tio­nen, Zeitlim­its, definierte Endzustände und unter­schiedliche Mod­ell­fam­i­lien für aus­führende und prüfende Agen­ten. Das Ziel ist aus­drück­lich nicht, Sprach­mod­elle deter­min­is­tisch zu machen. Ihr Ver­hal­ten soll sicht­bar, mess­bar, begren­zt und wieder­her­stell­bar wer­den.

Was daran trägt

Der Beitrag ver­legt den Fehlerort von der Oper­a­tion in die Beziehung. Das ist die richtige Analy­seein­heit. Stark ist auch die Fehlerko­r­re­la­tion: Unab­hängigkeit wird nicht unter­stellt, son­dern geprüft. Ver­schiedene For­mulierun­gen oder Quellen beweisen noch keine ver­schiede­nen blind­en Fleck­en; erst gemein­sam scheit­ernde Agen­ten zeigen, dass die ver­meintliche Gegenkon­trolle keine ist. Überzeu­gend ist schließlich das Hybrid­mod­ell, in dem das Sprach­mod­ell seman­tisch arbeit­et und deter­min­is­tis­ch­er Code fes­tlegt, wann und wie sich der Zus­tand ändert.

Die stille Voraussetzung

Alle diese Kon­trollen set­zen eine feste Regel­menge voraus: ein erwartetes Schema, geschützte Felder, Geschäft­sregeln, einen gülti­gen Endzu­s­tand. Gemessen wird die Abwe­ichung von einem vor­ab definierten Soll.

Auf ki-agenten.eu unter­schei­de ich drei Agen­ten­typen. Der regel­ge­bun­dene Agent führt vorgegebene Regeln aus. Der regelin­tel­li­gente Agent legt sie sit­u­a­tion­s­gerecht aus. Der rege­len­twer­fende Agent erzeugt oder verän­dert Regeln selb­st. Für den ersten Typ, und weit­ge­hend auch für den zweit­en, ist Xus Kon­trollmod­ell tragfähig. Beim drit­ten kehrt sich die Lage um. Ein Agent, der Über­gabefor­mate aushan­delt oder Koor­di­na­tion­skon­ven­tio­nen her­aus­bildet, erzeugt wom­öglich genau das, was ein Val­ida­tor als Abwe­ichung zählt, oder was er gar nicht erfasst. Wie solche emer­gen­ten Kon­ven­tio­nen entste­hen, war The­ma meines Beitrags „Die Regel ohne Urhe­ber” zu Bül­büls Sozi­olo­gie kün­stlich­er Agen­ten. Ein Schema-Val­ida­tor sieht sie nicht.

Wer legt den gültigen Zustand fest?

Der Beitrag behan­delt „valide Ter­minierung”, „kor­rek­te Entschei­dung” und „Con­straint Preser­va­tion” als tech­nis­che Größen. Offen bleibt, wer sie fes­tlegt und wem ein Fehler zugerech­net wird, der im Hand­off entste­ht und keinem einzel­nen Agen­ten zur Last fällt.

Niklas Luh­mann unter­schei­det in seinem Buch „Sozi­olo­gie des Risikos” (1991) Risiko und Gefahr: Ein Schaden ist Risiko, wenn er als Folge ein­er eige­nen Entschei­dung zugerech­net wird, und Gefahr, wenn er von außen kommt. Damit ver­bun­den ist die Unter­schei­dung zwis­chen Entschei­dern und Betrof­fe­nen. Xus Beispiel ist ein Sup­port-Fall mit dop­pel­ter Abbuchung und der Frage, ob eine Erstat­tung zuläs­sig ist. Führt ein Über­gabefehler zu ein­er falschen Erstat­tung, ist das für den Betreiber ein Risiko und für den Kun­den wom­öglich eine Gefahr. Keine der genan­nten Kenn­zahlen sagt, wer von bei­den Seit­en das ist. Dass diese Per­spek­tive für Mul­ti-Agen­ten-Sys­teme etwas erschließt, halte ich für eine vor­läu­fige These.

Kontrolle von außen oder in der Verfassung

Der Titel des Beitrags fordert eine berechen­bare Kon­trollschicht. Diese Schicht sitzt außer­halb der Agen­ten und greift über Mes­sung und Abbruch ein. Bei rege­len­twer­fend­en Agen­ten, so meine Ver­mu­tung, lässt sich Gov­er­nance nicht mehr nur als äußere Instanz denken. Sie müsste Teil der insti­tu­tionellen Kon­sti­tu­tion des Agen­ten wer­den: eine Entschei­dung vor der Aus­führung darüber, welche Regeln er über­haupt ändern darf und in welchem Ver­fahren.

Ein Teil des Beitrags weist bere­its in diese Rich­tung. Die Wahl ver­schieden­er Mod­ell­fam­i­lien für aus­führende und prüfende Agen­ten ist Gestal­tung vor der Aus­führung. Gemessen wird sie jedoch an fes­ten Test­daten­sätzen. Unklar bleibt auch, ob die Forderung nach Diver­sität für die Sprach­mod­elle gilt, die als Bew­ert­er und für die seman­tis­chen Zus­tand­sprü­fun­gen einge­set­zt wer­den. Der Text sagt dazu nichts; der Fehler der geteil­ten blind­en Fleck­en würde son­st eine Ebene höher wiederkehren.

Einordnung

In „Der Agent, der vor der Aus­liefer­ung geht” ging es um die Lücke zwis­chen Test und Prax­is bei einzel­nen Agen­ten. Xus Beitrag bet­rifft die Lücke zwis­chen Einze­la­gent und Kollek­tiv. Bei­de beant­worten die Frage, wie sich Agen­ten messen lassen, die an Vor­gaben gebun­den sind. Offen bleibt in bei­den, wie man Agen­ten beurteilt, die ihre Vor­gaben mit­gestal­ten. Das Kon­trollmod­ell ist für den regel­ge­bun­de­nen Fall überzeu­gend. Ob es darüber hin­aus reicht, ist vor­läu­fig nicht belegt.

Ralf Keu­per 


Quellen

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert