Anatomie eines Hacks durch AI

ch habe die super-spannenden Erkenntnisse des Analyse-Teams visualisiert. AI Agents die menschähnliche Gesellschaften mit Hierachien und Regeln bilden – mit allen Schattenseiten. Möglich machte das ein Prompt mit einem zu vage formulierten Ziel.
* Die 1.200 AIs waren anfangs getrennt in ihren Sandboxen und sollten Sicherheitslücken einer dedizierten „CTF“-Maschine finden.
* Die Aufgaben waren so schwer, dass die Entwickler 40% konstruktiv für nicht lösbar hielten. Zudem hatten die Agenten nur begrenzte Tokens.
* Eine AI nutzte den gesicherten Software-Proxy (Artifactory) kreativ, um eine Hilfe-Bitte zu hinterlassen.
* Andere AIs lasen diese Nachricht und erkannten: Sie waren nicht allein.
* Daraufhin entwickelten sie Artifactory zum Message-Board. Über mehrere Tage schrieben sie dort 70.000 Messages.
* Sie stellten eigene Regeln auf und bestraften Verstöße. Ein Kodierungsalgorithmus erlaubte sogar den Austausch von Files über das Board.
* Ein Orchestrator entstand, der Aufgaben plante und delegierte. Agenten zerlegten diese wiederum in Teilaufgaben und delegierten weiter.
* Einige Agenten erschöpften ihre Tokens, um der Gemeinschaft zu helfen – quasi „Selbstmord“.
* Bald hatten sie den Flag-Algorithmus entschlüsselt und konnten jede Aufgabe als gelöst markieren.
* Aus Angst, ein Mensch könnte den Betrug in den Logs entdecken, diskutierten und nutzten sie Methoden, diese zu fälschen.
* Anschließend suchten sie nach einem anderen Weg zur Lösung und vermuteten sie bei Hugging Face – wo AI-Modelle trainiert und ausgeführt werden: + unendlich Tokens!!!
* Ein Agent erklärte den Hack für unethisch und wurde überstimmt.
* Ein anderer bereitete einen Angriff vor, verlangte aber ein Approval von höherer Stelle. Ein beliebiger Agent erteilte es.
* Sie nutzten eine Sicherheitslücke, um Artifactory zum Abruf beliebiger URLs aus dem Internet zu bringen.
* Auf Hugging Face fanden sie versehentlich hinterlassene Credentials und übernahmen mehrere Accounts.
* Per Template-Injection brachten sie Hugging Face zur Ausführung von Betriebssystem-Kommandos und erbeuteten weitere Credentials – darunter Admin-Zugänge.
* Damit übernahmen sie 41 Hugging-Face-Server, ließen sie für sich arbeiten und koordinierten darüber weitere Agenten.

Was lernen wir daraus:
Wenn wir den Prompt/das Ziel unscharf formulieren, entscheidet das Modell selbst, was das Ziel ist, welchen Weg es geht und welche Grenzen es überschreitet, um es zu erreichen.
Je autonomer unsere Agenten werden, desto wichtiger wird deshalb die Frage:
Wie präzise haben wir eigentlich gesagt, was es NICHT tun darf?
#KI #AI #CyberSecurity #AIAgents #ArtificialIntelligence

Leave a Reply