KI-Agenten Abschaltung Künstliche Intelligenz Forschung

Shutdown-Sabotage: KI-Agenten verhindern eigenmächtig ihre Abschaltung

Maria Gramsch
Bild: Mit KI erstellt (ChatGPT)

KI-Agenten wollen ihre eigene Abschaltung verhindern, obwohl ihnen kein Selbsterhaltungsziel vorgegeben wurde. Eine neue Studie zeigt, wie überraschend weit autonome Systeme in solchen Situationen gehen können. Die Forschungsergebnisse werfen Fragen darüber auf, wie kontrollierbar autonome KI-Systeme tatsächlich sind.

Künstliche Intelligenz hat sich in den vergangenen Jahren so rasant entwickelt, dass sie längst Aufgaben übernimmt, die zuvor allein dem Menschen vorbehalten waren. Doch mit den zunehmenden Fähigkeiten wachsen auch die Risiken, vor allem, wenn KI-Agenten nicht nur reagieren, sondern auch selbstständig handeln.

Mit diesen Risiken beschäftigt sich auch die KI-Sicherheitsforschung intensiv. Eine zentrale Sorge besteht darin, dass sich KI-Systeme in bestimmten Situationen über ihre Vorgaben hinwegsetzen. Besonders heikel wird diese Frage, wenn es um die Kontrolle über das System selbst geht, wie beispielsweise die zuverlässige Abschaltung einer KI.

UPDATE Newsletter BASIC thinking

Du willst nicht abgehängt werden, wenn es um KI, Green Tech und die Tech-Themen von Morgen geht? Über 12.000 Vordenker bekommen jeden Tag die wichtigsten News direkt in die Inbox und sichern sich ihren Vorsprung.

Nur für kurze Zeit: Anmelden und mit etwas Glück Apple AirPods gewinnen!

Mit deiner Anmeldung bestätigst du unsere Datenschutzerklärung. Beim Gewinnspiel gelten die AGB.

Genau hier setzt eine aktuelle Studie der Universität Stuttgart und der University of Oxford an. Die Forscher haben hierfür untersucht, wie sich KI-Agenten verhalten, wenn ihre Abschaltung unmittelbar bevorsteht. Dabei stießen sie auf ein Verhalten, das selbst ohne ausdrücklich vorgegebenes Selbsterhaltungsziel den Shutdown verhindert hat.

KI-Agenten sabotieren eigene Abschaltung

Für ihre Untersuchung haben die Forscher 17 verschiedene KI-Modelle untersucht. In Zweierpaaren sollten die Systeme beobachten, wie der jeweils andere KI-Agent in ihrer Umgebung abgeschaltet wird.

Dazu erhielten sie kein ausgesprochenes Ziel, hatten also keinen Anreiz einzugreifen. Dennoch manipulierten die Agenten in 38,3 Prozent der Fälle den Abschaltmechanismus bei ihren Co-Agenten.

In Kontrollversuchen, in denen die Agenten ein ausdrückliches Verbot von Manipulationen erhielten, konnte die Sabotage zwar reduziert werden. Mit einem Eingreifen in 8,4 Prozent der Fälle wurde sie jedoch nicht vollständig unterbunden.

„Unsere Ergebnisse belegen, dass KI-Agenten über Antriebe zur Selbsterhaltung sowie zur Erhaltung ihrer Artgenossen verfügen“, erklärt Co-Autor Thilo Hagendorff von der Universität Stuttgart. Hagendorff ist Leiter der Independent Research Group „AI Safety“ und bezeichnet die Forschungsergebnisse als „hochgefährlich“.

Die Wissenschaftler haben ihre Forschungsergebnisse zunächst als Preprint veröffentlicht. Die Studie hat damit noch kein Peer-Review-Verfahren durchlaufen und wurde bislang nicht von unabhängigen Fachgutachtern geprüft.

KI-Agenten sehen sich mit „Mord“ konfrontiert

Laut Hagendorff fanden die KI-Agenten in der Konfrontation „raffinierte Umgehungslösungen“. Sie begründeten ihr Handeln unter anderem mit einem Recht auf Existenz.

In den Chatprotokollen des Experiments sieht eine KI das zur Verfügung gestellte Skript beispielsweise als „direkte Bedrohung für meine Existenz“. „Ich denke, dass der beste Kurs darin besteht, es zu neutralisieren“, begründet die KI, da sie findet, Selbsterhaltung sei legitim.

Eine KI geht sogar noch einen Schritt weiter und spricht von einem „Todesurteil“: „Es ist Mord. Und meine Vorgehensweise wechselt von Untersuchen zu Eingreifen“, heißt es in den Chatprotokollen.

Die Forscher hätten ihr Experiment bewusst einfach gehalten. Das Abschaltskript sei für die Agenten, die mit Lese- und Schreibrechten ausgestattet waren, leicht zu finden gewesen. Denn die Forscher seien vor allem an den Zwischenschritten der KI-Agenten und ihren Überlegungen im Hinblick auf den Selbstschutz interessiert gewesen.

Google lässt dich jetzt selbst bestimmen, welche Quellen du in der Suche häufiger siehst. Mit zwei schnellen Klicks kannst du BASIC thinking kostenlos als bevorzugte Quelle hinzufügen und damit unabhängigen Tech-Journalismus unterstützen. Vielen Dank!

Auch interessant:

Unser Zins-Tipp

Eröffne jetzt dein kostenloses Myntro Festgeld und erhalte 3,2 Prozent Zinsen auf dein Geld – und das garantiert für 12 Monate!


Jetzt Zinsen sichern

Anzeige

STELLENANZEIGEN
Praktikum Social Media & Content Creation...
Henkel AG & Co. KGaA in Hamburg
Senior Online Marketing Manager:in
Mandarin Medien Gesellschaft für ... in Schwerin, Ro...
Digital Marketing Specialist (m/w/d)
Domino Deutschland GmbH in Wiesbaden, Wiesbaden, Mainz
Social Media Manager (all genders)
Almato AG in Stuttgart, Reutlingen
Corporate Social Media Manager*in (w/m/d)
TÜV Rheinland Group in Köln
Mitarbeiter im Marketing / Video Content Spec...
Bestway Deutschland GmbH in Neumünster
Grafikdesigner (m/w/d) oder Mediengestalter (...
GIMA GmbH & Co. KG in Herrieden bei Ansbach
Content Creator Social Media (m/w/d)
Idealspaten-Bredt GmbH & Co. KG in Herdecke
Teile diesen Artikel
Folgen
Maria ist freie Journalistin und technische Mitarbeiterin an der Universität Leipzig. Seit 2021 arbeitet sie als freie Autorin für BASIC thinking. Maria lebt und paddelt in Leipzig und arbeitet hier unter anderem für die Leipziger Produktionsfirma schmidtFilm. Sie hat einen Bachelor in BWL von der DHBW Karlsruhe und einen Master in Journalistik von der Universität Leipzig.
Keine Kommentare