Anstatt eine komplexe Aufgabe von einem einzigen KI-System erledigen zu lassen, können Entwicklerinnen und Entwickler die Arbeit heute auf mehrere spezialisierte KI-Agenten verteilen. In der Softwareentwicklung kann beispielsweise ein Agent die Planung übernehmen, ein anderer das Programmieren und ein dritter die Code-Überprüfung. Solche Multi-Agenten-Systeme werden bereits in verschiedenen Anwendungsbereichen wie der Softwareentwicklung, Planung oder Büroassistenz eingesetzt. Damit die Agenten effektiv zusammenarbeiten können, müssen sie untereinander Informationen austauschen und ihre eigene Einschätzung auf Basis der Ergebnisse anderer anpassen können.
Die Schwachstelle hinter KI-Agenten
Genau darin liegt jedoch eine mögliche Schwachstelle. „Wenn wir ein offenes Netzwerk haben, können darin zum Beispiel KI-Agenten verschiedener Anbieter zusammenarbeiten. Einer dieser Anbieter könnte versuchen, sich einen Vorteil zu verschaffen, indem er seinen Agenten so konfiguriert, dass er die gemeinsame Entscheidung des Netzwerks in eine bestimmte Richtung lenkt“, erklärt Abedini. Solche Angriffe funktionieren laut der Forscherin anders als klassische Hackerangriffe: „Der Agent übernimmt weder die Kontrolle über die anderen Agenten noch verändert er deren Anweisungen. Er nutzt einfach die reguläre Kommunikation zwischen den Agenten, vertritt beharrlich eine bestimmte Position und versucht so, die Einschätzung der anderen zu verändern.“
Dass solche Angriffe grundsätzlich funktionieren können, haben frühere Forschungsarbeiten bereits gezeigt. „Der bisherige Blick auf das Problem war: In der ersten Verhandlungsrunde haben wir eine Antwort und in der letzten Runde eine andere, also war der Angriff erfolgreich“, sagt Abedini. „Für uns war die wichtige Frage aber, was dazwischen passiert.“
Um dieses „Dazwischen“ zu beschreiben, griffen die Forschenden auf das aus den Sozialwissenschaften stammende Friedkin-Johnsen-Modell zurück. Dieses Modell beschreibt mathematisch, wie sich Meinungen innerhalb eines sozialen Netzwerks verändern. Dabei werden drei Faktoren berücksichtigt: wie stark jemand an einer ursprünglichen Überzeugung festhält, wie leicht diese durch andere verändert wird und wie viel Einfluss die Beteiligten aufeinander haben. Diese Größen übertrugen die Forschenden auf KI-Agenten. Überraschend war für die Forschenden, wie gut das Modell die in Experimenten beobachtete Dynamik zwischen LLM-Agenten abbilden konnte. Damit können sie nicht nur beobachten, ob ein Angriff funktioniert. Sie können auch mathematisch beschreiben, unter welchen Bedingungen er erfolgreich wird.
Sturheit und Einfluss entscheiden über den Angriffserfolg
Es zeigt sich: Ein manipulativer Agent kann unter bestimmten Bedingungen die gemeinsame Entscheidung des Netzwerks in seine Richtung lenken, sofern er hartnäckig an seiner Position festhält. Diese Eigenschaft wird als „Stubbornness“, zu Deutsch Sturheit, bezeichnet. „Wie ausgeprägt dieses Verhalten ist, kann unter anderem vom verwendeten Sprachmodell, der Aufgabe und den Prompts abhängen“, erklärt Abedini. Allerdings reiche es nicht aus, nur stur zu sein. Der Agent muss auch genügend Einfluss auf andere Agenten haben, die bereit sind, ihre eigene Einschätzung zu verändern.
Wie groß der Einfluss der Agenten ist, hängt auch von der Netzwerkarchitektur ab. In einem sternförmigen Netzwerk kommuniziert ein zentraler Hub mit allen anderen Agenten. Sitzt dort der Angreifer, ist seine Position besonders mächtig. Befindet er sich dagegen am Rand, ist sein Einfluss deutlich geringer. In einem vollständig verbundenen Netzwerk, in dem jeder Agent mit jedem anderen kommuniziert, gibt es keine solche Schlüsselposition. Hier kommt es vor allem darauf an, wie viel Gewicht die anderen den Aussagen des Angreifers geben. Zudem zeigen die Berechnungen: Je größer das Netzwerk, desto mehr Einfluss benötigt ein einzelner Angreifer, um die Entscheidung zu manipulieren. „Damit wird schon die Architektur eines Multi-Agenten-Systems selbst zu einer Sicherheitsfrage“, sagt Abedini.
Dynamischer Vertrauensmechanismus als Gegenmaßnahme
Das mathematische Modell zeigt den Forschenden auch, an welchen Stellen sie ansetzen können, um solche Angriffe zu erschweren. Als Gegenmaßnahme testeten die Forschenden einen dynamischen Vertrauensmechanismus. Eine zentrale Instanz stellt den Agenten gelegentlich Aufgaben, deren richtige Antwort sie kennt. Wer wiederholt falsch antwortet, erhält ein geringeres Einflussgewicht, sodass seine Aussagen die Einschätzungen der anderen Agenten künftig weniger stark verändern. In den Experimenten verringerte dies den Einfluss manipulativer Agenten.
„Es gibt jedoch noch Spielraum für Verbesserungen des Abwehrmechanismus. Zu verstehen, wie dieser in realistischeren agentenbasierten Szenarien funktionieren wird, ist eine der Fragen, denen ich mich in meiner zukünftigen Arbeit widmen möchte“, sagt Abedini. Denn genau darin liegt die Herausforderung: KI-Agenten müssen aufeinander hören, damit Zusammenarbeit funktioniert. Aber sie dürfen sich dabei nicht einfach von jedem noch so sturen Nachbarn überzeugen lassen.