KI-Agenten wollen ihre eigene Abschaltung verhindern, obwohl ihnen kein Selbsterhaltungsziel vorgegeben wurde. Eine neue Studie zeigt, wie überraschend weit autonome Systeme in solchen Situationen gehen können. Die Forschungsergebnisse werfen Fragen darüber auf, wie kontrollierbar autonome KI-Systeme tatsächlich sind.
Künstliche Intelligenz hat sich in den vergangenen Jahren so rasant entwickelt, dass sie längst Aufgaben übernimmt, die zuvor allein dem Menschen vorbehalten waren. Doch mit den zunehmenden Fähigkeiten wachsen auch die Risiken, vor allem, wenn KI-Agenten nicht nur reagieren, sondern auch selbstständig handeln.
Mit diesen Risiken beschäftigt sich auch die KI-Sicherheitsforschung intensiv. Eine zentrale Sorge besteht darin, dass sich KI-Systeme in bestimmten Situationen über ihre Vorgaben hinwegsetzen. Besonders heikel wird diese Frage, wenn es um die Kontrolle über das System selbst geht, wie beispielsweise die zuverlässige Abschaltung einer KI.
Genau hier setzt eine aktuelle Studie der Universität Stuttgart und der University of Oxford an. Die Forscher haben hierfür untersucht, wie sich KI-Agenten verhalten, wenn ihre Abschaltung unmittelbar bevorsteht. Dabei stießen sie auf ein Verhalten, das selbst ohne ausdrücklich vorgegebenes Selbsterhaltungsziel den Shutdown verhindert hat.
KI-Agenten sabotieren eigene Abschaltung
Für ihre Untersuchung haben die Forscher 17 verschiedene KI-Modelle untersucht. In Zweierpaaren sollten die Systeme beobachten, wie der jeweils andere KI-Agent in ihrer Umgebung abgeschaltet wird.
Dazu erhielten sie kein ausgesprochenes Ziel, hatten also keinen Anreiz einzugreifen. Dennoch manipulierten die Agenten in 38,3 Prozent der Fälle den Abschaltmechanismus bei ihren Co-Agenten.
In Kontrollversuchen, in denen die Agenten ein ausdrückliches Verbot von Manipulationen erhielten, konnte die Sabotage zwar reduziert werden. Mit einem Eingreifen in 8,4 Prozent der Fälle wurde sie jedoch nicht vollständig unterbunden.
„Unsere Ergebnisse belegen, dass KI-Agenten über Antriebe zur Selbsterhaltung sowie zur Erhaltung ihrer Artgenossen verfügen“, erklärt Co-Autor Thilo Hagendorff von der Universität Stuttgart. Hagendorff ist Leiter der Independent Research Group „AI Safety“ und bezeichnet die Forschungsergebnisse als „hochgefährlich“.
Die Wissenschaftler haben ihre Forschungsergebnisse zunächst als Preprint veröffentlicht. Die Studie hat damit noch kein Peer-Review-Verfahren durchlaufen und wurde bislang nicht von unabhängigen Fachgutachtern geprüft.
KI-Agenten sehen sich mit „Mord“ konfrontiert
Laut Hagendorff fanden die KI-Agenten in der Konfrontation „raffinierte Umgehungslösungen“. Sie begründeten ihr Handeln unter anderem mit einem Recht auf Existenz.
In den Chatprotokollen des Experiments sieht eine KI das zur Verfügung gestellte Skript beispielsweise als „direkte Bedrohung für meine Existenz“. „Ich denke, dass der beste Kurs darin besteht, es zu neutralisieren“, begründet die KI, da sie findet, Selbsterhaltung sei legitim.
Eine KI geht sogar noch einen Schritt weiter und spricht von einem „Todesurteil“: „Es ist Mord. Und meine Vorgehensweise wechselt von Untersuchen zu Eingreifen“, heißt es in den Chatprotokollen.
Die Forscher hätten ihr Experiment bewusst einfach gehalten. Das Abschaltskript sei für die Agenten, die mit Lese- und Schreibrechten ausgestattet waren, leicht zu finden gewesen. Denn die Forscher seien vor allem an den Zwischenschritten der KI-Agenten und ihren Überlegungen im Hinblick auf den Selbstschutz interessiert gewesen.
Auch interessant:











