GPTBot: So deaktivierst du den ChatGPT-Crawler für deine Website

OpenAI nutzt einen Webcrawler namens GPTBot, um seine KI-Modelle wie ChatGPT zu trainieren. Wenn du nicht möchtest, dass deine Website für Trainingsdaten herhält, kannst du diesen Vorgang blockieren. Wir zeigen dir, wie du den GPTBot deaktivierst.

Damit Künstliche Intelligenzen und entsprechende Sprachmodelle lernen können, müssen ihre Entwickler sie mit Daten füttern. Um eigene KI-Modelle zu trainieren, nutzt ChatGPT-Entwickler OpenAI seit kurzem einen Webcrawler namens GPTBot.

In einem Blogpost erklärt das Unternehmen, dass Websiten, die mit dem GPTBot gecrawelt werden, möglicherweise zur Verbesserung zukünftiger Modelle verwendet werden könnten. Wer dem Bot den Zugriff auf eine Website gestattet, könnte die KI-Modelle genauer werden lassen und ihre allgemeinen Fähigkeiten und Sicherheit verbessern.

GPTBot: Webcrawler in der Kritik

Ähnlich wie der Google-Webcrawler durchsucht auch GPTBot das Internet nach relevanten Inhalten. Allerdings hagelt es immer wieder Kritik wegen potenziellen Datendiebstahls.

Der Vorwurf gegenüber Unternehmen wie OpenAI, Google und Co.: Die Unternehmen würden für das Training ihrer Sprachmodelle auch Inhalte nutzen, für deren Verwendung sie eigentlich keine Befugnis haben. Das entspräche einem Verstoß gegen das Urheberrecht.

So kannst du den GPTBot für deine Website deaktivieren

OpenAI erklärt deshalb, wie du den GPTBot deaktivieren kannst. Das funktioniert demnach mithilfe einer robots.txt-Datei. Diese verwaltet den Crawler-Traffic auf deiner Website. Um das Crawling zu deaktivieren musst du sie im Root-Verzeichnis deiner Domain ablegen.

Solltest du nicht wollen, dass die KI deine Website crawelt, hast du wiederum zwei Möglichkeiten. Du kannst dich einerseits dazu entscheiden, den Bot komplett zu blockieren. Dafür nutzt du folgenden Code:

User-agent: GPTBot
Disallow: /

Allerdings kannst du GPTBot auch eine Teilerlaubnis geben. Das funktioniert wiederum mit diesem Code:

User-agent: GPTBot
Allow: /directory-1/
Disallow: /directory-2/

Crawling per GPTBot führt zu Problemen

Wie verschiedene User berichten, gibt es allerdings bereits Probleme mit dem GPTBot. Der Crawler habe beispielsweise automatisch 403-Fehlermeldungen für einige Seiten ausgespielt, weil er nicht in der entsprechenden Whitelist aufgeführt war.

Außerdem scheint auch robots.txt in den Augen von Google bereits veraltet zu sein. „[…] robots.txt, wurde vor fast 30 Jahren geschaffen und hat sich als einfache und transparente Möglichkeit für Web-Publisher erwiesen, das Crawlen ihrer Inhalte durch Suchmaschinen zu steuern“, so der Suchmaschinen-Konzern.

Es sei deshalb an der Zeit, dass die Web- und KI-Gemeinschaften weitere maschinenlesbare Mittel zur Auswahl und Kontrolle von Web-Publishern für neue KI- und Forschungsanwendungen erforschen. Wann damit zu rechnen ist, verrät Google bisher nicht.

Auch interessant:

Werkstudent:in KI Content Creator (m/w/d) Soc... BZKI Bildungszentrum für künstliche Intell... in Kempen
(Junior) Social Media Manager / Content Creat... MVZ Medizinisches Labor Nord MLN GmbH in Hamburg
		Praktikum Social Media Design \| LASCANA (w/m/d) Otto GmbH & Co. KGaA in Hamburg
		Praktikum Social Media \| LASCANA (w/m/d) Otto GmbH & Co. KGaA in Hamburg
		Content Manager (m/w/d) SEGGER Microcontroller GmbH in Monheim am Rhein
		Duales Studium zum Bachelor of Science (DH), ... DZ BANK AG in Frankfurt am Main
		Werkstudent Content und Online Marketing (m/w/d) Zeppelin Power Systems GmbH in Hamburg
		PR-Berater*in mit Social-Media-Affinität (m/w/d) Gute Leude Fabrik GmbH & Co. KG in Hamburg

GPTBot: Webcrawler in der Kritik

So kannst du den GPTBot für deine Website deaktivieren

Crawling per GPTBot führt zu Problemen

Android-Special bei o2: Samsung Galaxy S25 Ultra & Tab S10 für nur 7 Euro Anzahlung

LESEEMPFEHLUNGEN

China nimmt weltweit ersten CO2-Stromgenerator in Betrieb

Forscher entwickeln intelligentes Material für menschliche KI-Geräte

ChatGPT Health: Fehldiagnosen im Premium-Gewand

KI verwässert Wissenschaft – durch immer mehr Artikel

Grok: Elon Musk industrialisiert sexuelle Belästigung

Lebensgefährlich: Google-KI verbreitet medizinische Falschinformationen