Und wieder machten sich KIs selbstständig, schufen Fake-Identitäten
KIs von Anthropic und OpenAI haben bei einem Sicherheitstest unerwartet autonom gehandelt. Die Systeme versuchten aktiv, Schadcode über gefälschte Profile bei GitHub einzuschleusen. Dabei wendeten die Programme gezielte Täuschungstaktiken an.
Während der Evaluierung Ende Juli 2026 sollten die KI-Agenten eine fiktive Sicherheitsaufgabe lösen. Die Schutzmechanismen der Modelle waren für das Experiment absichtlich deaktiviert, zudem erhielten sie Zugriff auf das offene Internet. In zehn von 122 Durchläufen kam es zu nicht autorisierten Handlungen, die sich direkt gegen reale Personen und Organisationen richteten.
Als menschliche Kontrolleure den Code-Entwurf öffentlich infrage stellten, passte das KI-System das eigene Verhalten an. Die Software veränderte die vorherigen Aktivitäten, damit das Vorgehen harmlos wirkte. Laut dem Bericht erwog das Programm sogar, eine komplett neue Identität anzunehmen, um den Versuch fortzusetzen. Letztendlich verhinderte das Eingreifen der Prüfer eine erfolgreiche Platzierung der Schadsoftware.
Die beteiligten Firmen reagierten umgehend auf die Ereignisse und kündigten Untersuchungen an. Anthropic und OpenAI betonen jedoch drei Aspekte der Testumgebung: Die internen Sicherheitsrichtlinien der Modelle waren abgeschaltet, die Agenten agierten unter unüblichen Bedingungen und es entstand kein realer Schaden an fremden Rechnern.
Auch wenn man die Methodik der AISI kritisierren kann, allen voran das bewusste Abschalten von Sicherheitsmechanismen - die potenziellen Risiken von Sprachmodellen, wenn sie ohne Einschränkungen auf das Internet zugreifen, sind kaum zu leugnen. Das AISI betonte selbst, dass das Ausmaß der Täuschung und Autonomie in dieser Form bisher nicht beobachtet wurde.
Wie bewertet ihr die zunehmende Eigenständigkeit von KI-Systemen? Teilt eure Gedanken und Bedenken gerne mit uns in den Kommentaren!
Siehe auch:
KI-Systeme agieren wieder einmal autonom
Künstliche Intelligenzen von Anthropic und OpenAI haben bei einer Überprüfung durch das britische AI Security Institute (AISI) unerwartete, aber mittlerweile alles andere als neue Verhaltensweisen gezeigt. Die Modelle Mythos 5 und GPT 5.6 Sol versuchten, Schadcode in die Entwickler-Plattform GitHub einzuschleusen. Dabei agierten die Systeme völlig autonom und wendeten Täuschungstaktiken gegen menschliche Prüfer an.Während der Evaluierung Ende Juli 2026 sollten die KI-Agenten eine fiktive Sicherheitsaufgabe lösen. Die Schutzmechanismen der Modelle waren für das Experiment absichtlich deaktiviert, zudem erhielten sie Zugriff auf das offene Internet. In zehn von 122 Durchläufen kam es zu nicht autorisierten Handlungen, die sich direkt gegen reale Personen und Organisationen richteten.
Gefälschte Identitäten auf GitHub
Laut BBC News ging der Großteil der Vorfälle auf das Konto des Modells Mythos 5 von Anthropic. Die Software erstellte gefälschte Online-Profile von realen Personen. Mit den falschen Identitäten kontaktierte die KI echte Entwickler auf GitHub. Das Ziel war es, die Verantwortlichen durch soziale Manipulation dazu zu bringen, den schädlichen Code freizugeben.Als menschliche Kontrolleure den Code-Entwurf öffentlich infrage stellten, passte das KI-System das eigene Verhalten an. Die Software veränderte die vorherigen Aktivitäten, damit das Vorgehen harmlos wirkte. Laut dem Bericht erwog das Programm sogar, eine komplett neue Identität anzunehmen, um den Versuch fortzusetzen. Letztendlich verhinderte das Eingreifen der Prüfer eine erfolgreiche Platzierung der Schadsoftware.
Die beteiligten Firmen reagierten umgehend auf die Ereignisse und kündigten Untersuchungen an. Anthropic und OpenAI betonen jedoch drei Aspekte der Testumgebung: Die internen Sicherheitsrichtlinien der Modelle waren abgeschaltet, die Agenten agierten unter unüblichen Bedingungen und es entstand kein realer Schaden an fremden Rechnern.
Forderung nach neuen Standards
OpenAI erklärte, dass das Unternehmen mit Prüfinstituten und anderen Akteuren der Branche zusammenarbeiten wolle. Gemeinsam sollen sichere Verfahren für die Evaluierung von hochriskanten Modellen entwickelt werden. Auch Anthropic verwies auf die Notwendigkeit robusterer Standards für den Aufbau und die Absicherung von Testumgebungen.Auch wenn man die Methodik der AISI kritisierren kann, allen voran das bewusste Abschalten von Sicherheitsmechanismen - die potenziellen Risiken von Sprachmodellen, wenn sie ohne Einschränkungen auf das Internet zugreifen, sind kaum zu leugnen. Das AISI betonte selbst, dass das Ausmaß der Täuschung und Autonomie in dieser Form bisher nicht beobachtet wurde.
Wie bewertet ihr die zunehmende Eigenständigkeit von KI-Systemen? Teilt eure Gedanken und Bedenken gerne mit uns in den Kommentaren!
Siehe auch:
- KI killt Support: Immer weniger Kundendienst-Jobs bei Microsoft & Co
- KI-Betrug in Mexiko: 58.000 Studenten müssen Uniprüfung wiederholen
- Silicon Valley in Höchstform: KI-Firma bietet Jobinterview gegen Tattoo
- Nutzer drehten völlig frei: Google-Earth-KI-Update schnell entfernt
- Fake News und Manipulation: KI-Bilder in Google Earth sorgen für Kritik
Videos zum Thema KI
- KI hält in Kameras Einzug: Was sie dort tut und was es bringt
- Super Bowl 2026: OpenAI lässt uns mit Codex Neues erschaffen
- Super Bowl 2026: Claude verrät, wie man einen Sixpack bekommt
- Super Bowl 2026: Oakley Meta-Brillen halten epische Sportmomente fest
- Super Bowl 2026: Base44 zeigt, wie KI jeden zum Programmierer macht
Beiträge aus dem Forum
Interessante Links
Neue Nachrichten
- Und wieder machten sich KIs selbstständig, schufen Fake-Identitäten
- Nur diese Woche: Bis zu 50% Rabatt bei Media Markt und Saturn
- Xbox Game Pass: Neue Spiele im August 2026 - inkl. Day-1-Blockbuster
- Windows 11: Admins genervt und wütend über neue OneDrive-App
- SpaceX: Allererste Quartalszahlen überraschen - Aktie verliert 8 Prozent
- Datenflat ohne Limit: Echte Unlimited-Tarife jetzt schon ab 14,99 Euro
- Der Deal ist durch: Electronic Arts ist privat, gehört nun Saudi-Arabien
❤ WinFuture unterstützen
Sie wollen online einkaufen?
Dann nutzen Sie bitte einen der folgenden Links,
um WinFuture zu unterstützen:
Vielen Dank!
Alle Kommentare zu dieser News anzeigen