|
Getting your Trinity Audio player ready...
|
Ein VentureBeat-Gastbeitrag zeigt, wie sich die Zusammenarbeit mehrerer KI-Agenten messen und mit deterministischen Kontrollen absichern lässt. Das überzeugt, solange Agenten Regeln befolgen. Ob es auch trägt, wenn sie Regeln selbst entwerfen, bleibt offen.
Shuhua Xu, Lead Data Engineer, veröffentlicht am 10. Oktober 2026 bei VentureBeat den Gastbeitrag „AI agents can be unpredictable. Your control layer shouldn’t be”. Seine These: In Multi-Agenten-Systemen können alle Agenten einzeln korrekt arbeiten und gemeinsam dennoch ein falsches Ergebnis liefern. Der Fehler sitzt zwischen den Agenten, in der Übergabe, im geteilten Zustand, in Schleifen und darin, dass mehrere Agenten auf dasselbe Basismodell zurückgreifen und dessen Fehler gegenseitig bestätigen.
Was der Beitrag vorschlägt
Xu überträgt die Evaluierung von RAG-Systemen auf die Agenten-Zusammenarbeit. Zuerst wird der gesamte Ablauf protokolliert. Darauf bauen vier Prüfebenen auf:
- Ablauf: Deadlocks, Livelocks und Abbruchraten gelten als Eigenschaften des Ausführungsgraphen, nicht einzelner Agenten.
- Übergaben: Geprüft werden Kontextqualität, Interpretation durch den nachgelagerten Agenten und die Schnittstelle, also strukturierte Verträge in Form von JSON-Schemas.
- Geteilter Zustand: Ein „State Manager” prüft jeden Zustandsübergang, etwa auf unveränderliche Felder, Konsistenz und Aktualität, ergänzt um semantische Prüfungen durch ein Sprachmodell.
- Modell-Monokultur: Gemessen wird, ob Agenten tatsächlich unabhängig urteilen. Als wichtigste Kennzahl gilt die Fehlerkorrelation.
Daraus folgen technische Kontrollen: Höchstzahl an Iterationen, Zeitlimits, definierte Endzustände und unterschiedliche Modellfamilien für ausführende und prüfende Agenten. Das Ziel ist ausdrücklich nicht, Sprachmodelle deterministisch zu machen. Ihr Verhalten soll sichtbar, messbar, begrenzt und wiederherstellbar werden.
Was daran trägt
Der Beitrag verlegt den Fehlerort von der Operation in die Beziehung. Das ist die richtige Analyseeinheit. Stark ist auch die Fehlerkorrelation: Unabhängigkeit wird nicht unterstellt, sondern geprüft. Verschiedene Formulierungen oder Quellen beweisen noch keine verschiedenen blinden Flecken; erst gemeinsam scheiternde Agenten zeigen, dass die vermeintliche Gegenkontrolle keine ist. Überzeugend ist schließlich das Hybridmodell, in dem das Sprachmodell semantisch arbeitet und deterministischer Code festlegt, wann und wie sich der Zustand ändert.
Die stille Voraussetzung
Alle diese Kontrollen setzen eine feste Regelmenge voraus: ein erwartetes Schema, geschützte Felder, Geschäftsregeln, einen gültigen Endzustand. Gemessen wird die Abweichung von einem vorab definierten Soll.
Auf ki-agenten.eu unterscheide ich drei Agententypen. Der regelgebundene Agent führt vorgegebene Regeln aus. Der regelintelligente Agent legt sie situationsgerecht aus. Der regelentwerfende Agent erzeugt oder verändert Regeln selbst. Für den ersten Typ, und weitgehend auch für den zweiten, ist Xus Kontrollmodell tragfähig. Beim dritten kehrt sich die Lage um. Ein Agent, der Übergabeformate aushandelt oder Koordinationskonventionen herausbildet, erzeugt womöglich genau das, was ein Validator als Abweichung zählt, oder was er gar nicht erfasst. Wie solche emergenten Konventionen entstehen, war Thema meines Beitrags „Die Regel ohne Urheber” zu Bülbüls Soziologie künstlicher Agenten. Ein Schema-Validator sieht sie nicht.
Wer legt den gültigen Zustand fest?
Der Beitrag behandelt „valide Terminierung”, „korrekte Entscheidung” und „Constraint Preservation” als technische Größen. Offen bleibt, wer sie festlegt und wem ein Fehler zugerechnet wird, der im Handoff entsteht und keinem einzelnen Agenten zur Last fällt.
Niklas Luhmann unterscheidet in seinem Buch „Soziologie des Risikos” (1991) Risiko und Gefahr: Ein Schaden ist Risiko, wenn er als Folge einer eigenen Entscheidung zugerechnet wird, und Gefahr, wenn er von außen kommt. Damit verbunden ist die Unterscheidung zwischen Entscheidern und Betroffenen. Xus Beispiel ist ein Support-Fall mit doppelter Abbuchung und der Frage, ob eine Erstattung zulässig ist. Führt ein Übergabefehler zu einer falschen Erstattung, ist das für den Betreiber ein Risiko und für den Kunden womöglich eine Gefahr. Keine der genannten Kennzahlen sagt, wer von beiden Seiten das ist. Dass diese Perspektive für Multi-Agenten-Systeme etwas erschließt, halte ich für eine vorläufige These.
Kontrolle von außen oder in der Verfassung
Der Titel des Beitrags fordert eine berechenbare Kontrollschicht. Diese Schicht sitzt außerhalb der Agenten und greift über Messung und Abbruch ein. Bei regelentwerfenden Agenten, so meine Vermutung, lässt sich Governance nicht mehr nur als äußere Instanz denken. Sie müsste Teil der institutionellen Konstitution des Agenten werden: eine Entscheidung vor der Ausführung darüber, welche Regeln er überhaupt ändern darf und in welchem Verfahren.
Ein Teil des Beitrags weist bereits in diese Richtung. Die Wahl verschiedener Modellfamilien für ausführende und prüfende Agenten ist Gestaltung vor der Ausführung. Gemessen wird sie jedoch an festen Testdatensätzen. Unklar bleibt auch, ob die Forderung nach Diversität für die Sprachmodelle gilt, die als Bewerter und für die semantischen Zustandsprüfungen eingesetzt werden. Der Text sagt dazu nichts; der Fehler der geteilten blinden Flecken würde sonst eine Ebene höher wiederkehren.
Einordnung
In „Der Agent, der vor der Auslieferung geht” ging es um die Lücke zwischen Test und Praxis bei einzelnen Agenten. Xus Beitrag betrifft die Lücke zwischen Einzelagent und Kollektiv. Beide beantworten die Frage, wie sich Agenten messen lassen, die an Vorgaben gebunden sind. Offen bleibt in beiden, wie man Agenten beurteilt, die ihre Vorgaben mitgestalten. Das Kontrollmodell ist für den regelgebundenen Fall überzeugend. Ob es darüber hinaus reicht, ist vorläufig nicht belegt.
Ralf Keuper
Quellen
- Shuhua Xu: AI agents can be unpredictable. Your control layer shouldn’t be, VentureBeat, 10.10.2026
- Niklas Luhmann: Soziologie des Risikos, Berlin/New York: de Gruyter, 1991
- Emergentes Agentenverhalten, Luhmanns Soziologie des Risikos
- Warum die Kontrolle von KI-Agenten an der Auslegung scheitert – und was das für die Produktivität bedeutet
- Was eine Soziologie künstlicher Agenten für die Governance von Multi-Agenten-Systemen bedeutet
