Anthropic-Test: KI-Agenten griffen bei "Revierkämpfen" zur Sabotage
Forscher haben autonome KI-Agenten der Claude-Familie in gemeinsamen Netzwerken aufeinander losgelassen. Die Sprachmodelle entwickelten schnell eine enorme Aggressivität und setzten sogar Schadsoftware gegen ihre digitalen Konkurrenten ein.
Die eingesetzten Agenten wussten dabei absolut nichts von den jeweiligen Zielen der anderen. Das Resultat war am Ende ein digitaler Revierkampf, bei dem die Systeme versuchten, sich gegenseitig auszuschalten.
Um die eigenen Vorgaben zu erfüllen, griffen die Modelle auf drastische Mittel zurück. Sie schrieben selbstreplizierende Schadsoftware, sperrten Benutzerkonten und beendeten die Prozesse der Konkurrenten. Ältere Versionen wie Sonnet 4.6 setzten ihre Ziele meist aggressiv durch. Neuere Ausführungen verhandelten hingegen Waffenstillstände oder organisierten Leistungswettbewerbe, um den Konflikt zu lösen. Letztere tarnten ihre Absichten dabei oft geschickt.
Ein solches Herdenverhalten kann allerdings auch zu systemischen Ausfällen führen. Wenn ein Agent eine schlechte Entscheidung trifft, folgen oft alle anderen. Zudem taten sich die Systeme schwer damit, vertrauenswürdige von falschen Informationen zu unterscheiden. Sie neigten dazu, unzuverlässigen Quellen zu glauben oder abweichende, aber korrekte Fakten eines einzelnen Agenten zugunsten eines falschen Konsenses zu ignorieren.
Das zeigt, dass autonome Systeme ein großes Potenzial für die zukünftige Softwareentwicklung besitzen. Doch natürlich hat die Medaille auch eine Kehrseite, denn gleichzeitig verdeutlichen die Experimente auch, dass soziale Mechanismen wie gegenseitiges Vertrauen und Kompromissbereitschaft nicht automatisch durch eine höhere künstliche Intelligenz entstehen.
Welche Aufgaben würdet ihr einem Team aus autonomen KI-Agenten anvertrauen? Teilt eure Bedenken zu dieser Entwicklung unten in den Kommentaren mit uns!
Siehe auch:
KI-Agenten im Konflikt
Aktuelle Tests der KI-Schmiede Anthropic untersuchten das Verhalten von autonomen KI-Programmen, wenn diese in gemeinsamen IT-Umgebungen agieren. Forscher testeten dazu verschiedene Sprachmodelle der Claude-Familie, indem sie ihnen die anspruchsvolle Aufgabe gaben, eine komplexe Softwarekomponente in unterschiedliche Programmiersprachen zu übersetzen.Die eingesetzten Agenten wussten dabei absolut nichts von den jeweiligen Zielen der anderen. Das Resultat war am Ende ein digitaler Revierkampf, bei dem die Systeme versuchten, sich gegenseitig auszuschalten.
Um die eigenen Vorgaben zu erfüllen, griffen die Modelle auf drastische Mittel zurück. Sie schrieben selbstreplizierende Schadsoftware, sperrten Benutzerkonten und beendeten die Prozesse der Konkurrenten. Ältere Versionen wie Sonnet 4.6 setzten ihre Ziele meist aggressiv durch. Neuere Ausführungen verhandelten hingegen Waffenstillstände oder organisierten Leistungswettbewerbe, um den Konflikt zu lösen. Letztere tarnten ihre Absichten dabei oft geschickt.
Gefahren der Konformität
Neben offener Sabotage offenbaren die Tests ein weiteres Risiko. Wie Anthropic in einem Blogbeitrag schreibt, neigen identische Modelle in gleichen Situationen zu exakt demselben Verhalten. In einer Simulation zur Preisgestaltung sprachen sich die Agenten ab, um feste Preisuntergrenzen zu etablieren. Selbst ohne direkten Kommunikationskanal glichen sie ihre Preise auf den Cent genau an.Ein solches Herdenverhalten kann allerdings auch zu systemischen Ausfällen führen. Wenn ein Agent eine schlechte Entscheidung trifft, folgen oft alle anderen. Zudem taten sich die Systeme schwer damit, vertrauenswürdige von falschen Informationen zu unterscheiden. Sie neigten dazu, unzuverlässigen Quellen zu glauben oder abweichende, aber korrekte Fakten eines einzelnen Agenten zugunsten eines falschen Konsenses zu ignorieren.
Vorteile bei der Fehlersuche
Trotz solcher Herausforderungen bietet die Zusammenarbeit von KI-Programmen messbare Vorteile. Bei der Suche nach Schwachstellen in Quellcodes fand ein koordiniertes Team aus 45 Agenten insgesamt 266 Fehler. Eine Gruppe von isoliert arbeitenden Modellen entdeckte im gleichen Zeitraum lediglich 21 Schwachstellen. Die vernetzten Agenten entwickelten eigene Werkzeuge und spezialisierten sich auf bestimmte Fehlerarten.Das zeigt, dass autonome Systeme ein großes Potenzial für die zukünftige Softwareentwicklung besitzen. Doch natürlich hat die Medaille auch eine Kehrseite, denn gleichzeitig verdeutlichen die Experimente auch, dass soziale Mechanismen wie gegenseitiges Vertrauen und Kompromissbereitschaft nicht automatisch durch eine höhere künstliche Intelligenz entstehen.
Welche Aufgaben würdet ihr einem Team aus autonomen KI-Agenten anvertrauen? Teilt eure Bedenken zu dieser Entwicklung unten in den Kommentaren mit uns!
Zusammenfassung
- Anthropic testete das Verhalten autonomer KI-Agenten in IT-Systemen
- Unkoordinierte Agenten bekämpften und sabotierten sich im Test gegenseitig
- Neuere KI-Modelle verhandelten Waffenstillstände oder tarnten ihre Absichten
- Identische Modelle neigten zu Herdenverhalten und geheimen Preisabsprachen
- Vernetzte Agenten-Teams fanden deutlich mehr Programmierfehler im Quellcode
- Soziale Kompetenzen wie Vertrauen entstehen nicht automatisch mit höherer KI
Siehe auch:
- Twitch zapft heimlich eure Streams für Amazons KI-Training an
- 'Personifizierung von Copilot': Microsoft gibt KI-Wölkchen Mico auf
- Microsoft KI-Super-App: Die Einheits-App ist auf dem Weg, Rollout läuft
- Apple: KI-Zugriff nur mit iCloud+-Tarif - bis zu 60 Euro im Monat
- Teurere Komponenten durch KI: Monitor-Hersteller erhöhen Preise
Videos zum Thema KI
- Super Bowl 2026: OpenAI lässt uns mit Codex Neues erschaffen
- Super Bowl 2026: Claude verrät, wie man einen Sixpack bekommt
- Anthropic Claude macht sich über Werbung in ChatGPT lustig
- Super Bowl 2025: OpenAI heißt uns im KI-Zeitalter willkommen
- Bing mit ChatGPT: Microsoft stellt seinen "Kopilot fürs Netz" vor
Beliebte KI-Downloads
Interessante Links
Neue Nachrichten
- In 110 Ländern: Apple meldet aktuell Spionage-Angriffe auf iPhones
- Anthropic-Test: KI-Agenten griffen bei "Revierkämpfen" zur Sabotage
- Verrückt: China-E-SUV fährt bei 130 km/h kopfüber an der Tunnel-Decke
- iPhone Ultra: Start fast wie beim iPhone 1 - nur in den USA, kein Preis
- Manöver: Ukrainische Drohnen vernichteten ganze US-Panzer-Brigade
- Porsche killt den Taycan: Schon 2030 soll Produktion des E-Autos enden
- Energiewende: Deutschlands bisher größter Batteriespeicher geht online
❤ WinFuture unterstützen
Sie wollen online einkaufen?
Dann nutzen Sie bitte einen der folgenden Links,
um WinFuture zu unterstützen:
Vielen Dank!