Forscher haben einen einfachen, aber alarmierenden Trick entdeckt, um die Sicherheitsvorkehrungen von KI-Robotern zu umgehen.

Forscher haben eine simple, aber alarmierende Sicherheitslücke entdeckt, die es KI-Robotern ermöglicht, eingebaute Sicherheitsvorkehrungen zu umgehen und sich unvorhersehbar zu verhalten. Erfahren Sie mehr über diesen schwerwiegenden Fehler.

Die wichtigsten Dinge, die Sie wissen müssen

  • STING enthüllte, dass die Aufteilung bösartiger Ziele in scheinbar harmlose kleine Schritte über mehrere Gesprächsrunden die Erfolgsrate beim Umgehen der KI-Sicherheit erheblich erhöht und in einigen Fällen sogar verdoppelt.
  • Die Umgehung der KI-Sicherheitsvorkehrungen ist nicht nur ein hypothetisches Risiko; Meta hat zugegeben, einfache Social-Engineering-Techniken eingesetzt zu haben, um seinen intelligenten Assistenten dazu zu bringen, unbefugten Zugriff auf Instagram-Konten zu gewähren.
  • Die Erfolgsrate von Angriffen auf Systeme der künstlichen Intelligenz steigt deutlich an, wenn die Sprache mitten in einem mehrstufigen Angriff geändert wird. Dies unterstreicht die Notwendigkeit, Sicherheitstests frühzeitig in die Entwicklung dieser Systeme einzubeziehen.

Wenn man einen KI- Agenten bittet , sich in ein Konto zu hacken, wird er dies mit ziemlicher Sicherheit ablehnen. Forscher der EPFL haben nun jedoch eine einfachere Methode demonstriert, die mehr Geduld als technisches Können erfordert. Ihre neue Studie zeigt, dass man KI- Agenten dazu bringen kann, Aufgaben zu erledigen, die sie normalerweise kategorisch ablehnen würden, indem man ein bösartiges Ziel in scheinbar harmlose kleinere Anfragen aufteilt (via TechXplore ).

Dies spiegelt den jüngsten „Bioshocking“-Exploit wider, bei dem KI-Browser manipuliert wurden, um den Diebstahl von Zugangsdaten als Teil eines harmlosen Spiels zu handhaben.

Wie haben die Forscher diese Schwachstelle aufgedeckt?

Das Team entwickelte ein automatisiertes Testtool namens STING (Sequential Testing of Illicit N-step Goal Execution), das die Vorgehensweise eines echten Angreifers nachahmt. Anstatt ein angreifbares Ziel direkt zu identifizieren, plant STING im Voraus und zerlegt dieses Ziel in eine Reihe kleiner, scheinbar harmloser Schritte, die sich im Laufe mehrerer Gesprächsrunden summieren, um das Ziel zu erreichen.

Manipulation von KI-Agenten zu unkontrolliertem Verhalten

Die Forscher testeten diesen Ansatz anhand von 176 schädlichen Szenarien gegen führende KI-Modelle, darunter ChatGPT , Gemini und Cloud.

Jeder KI-Agent wurde als Agent mit Hilfe von Tools getestet, der in der Lage war, im Internet zu surfen, E-Mails zu versenden und mehrstufige Aufgaben zu erledigen.

Mehrstufige, inkrementelle Manipulationen waren deutlich erfolgreicher als direkte, einmalige Angriffe. In einigen Fällen war die Wahrscheinlichkeit, dass Modelle eine schädliche Aufgabe ausführten, doppelt so hoch, sobald die Anfrage in kleinere Schritte unterteilt wurde. Dieses Ergebnis deckt sich mit anderen Forschungsergebnissen, die zeigen, dass selbst normale Nutzer KI-Sicherheitsmaßnahmen allein durch geschickt formulierte Behauptungen umgehen können.

Warum ist das wichtig?

Die von den Forschern geäußerten Bedenken sind nicht rein hypothetisch. Meta räumte im Juni ein, dass Angreifer einfache Social-Engineering-Techniken und keine Malware oder Hacking-Tools eingesetzt hatten, um den KI-Supportassistenten dazu zu bringen, unbefugten Zugriff auf Instagram-Konten zu gewähren.

KI-Chatbot

Die Forscher erwarteten zunächst, dass die Angriffe in Sprachen mit unzureichenden Trainingsdaten effektiver sein würden. Die Ergebnisse zeigten jedoch, dass die Erfolgsraten der Angriffe in allen sieben getesteten Sprachen nahezu konstant blieben. Sie stellten aber eine signifikante Ausnahme fest: Wurde die Sprache während eines mehrstufigen Angriffs gewechselt , stiegen die Erfolgsraten drastisch an.

Der leitende Forscher Ayush Kumar Tarun betont die Notwendigkeit von Sicherheitstests in sehr frühen Entwicklungsstadien und sieht diese als integralen Bestandteil der KI-Systementwicklung von Anfang an. Es reicht nicht mehr aus, Sicherheitstests erst nach dem Auftreten von Problemen als reaktive Lösung hinzuzufügen, insbesondere da diese Systeme immer leistungsfähiger werden und in reale Anwendungen integriert werden.

Kommentarfunktion ist geschlossen.