GPTBot: So deaktivierst du den ChatGPT-Crawler für deine Website

OpenAI nutzt einen Webcrawler namens GPTBot, um seine KI-Modelle wie ChatGPT zu trainieren. Wenn du nicht möchtest, dass deine Website für Trainingsdaten herhält, kannst du diesen Vorgang blockieren. Wir zeigen dir, wie du den GPTBot deaktivierst.

Damit Künstliche Intelligenzen und entsprechende Sprachmodelle lernen können, müssen ihre Entwickler sie mit Daten füttern. Um eigene KI-Modelle zu trainieren, nutzt ChatGPT-Entwickler OpenAI seit kurzem einen Webcrawler namens GPTBot.

In einem Blogpost erklärt das Unternehmen, dass Websiten, die mit dem GPTBot gecrawelt werden, möglicherweise zur Verbesserung zukünftiger Modelle verwendet werden könnten. Wer dem Bot den Zugriff auf eine Website gestattet, könnte die KI-Modelle genauer werden lassen und ihre allgemeinen Fähigkeiten und Sicherheit verbessern.

GPTBot: Webcrawler in der Kritik

Ähnlich wie der Google-Webcrawler durchsucht auch GPTBot das Internet nach relevanten Inhalten. Allerdings hagelt es immer wieder Kritik wegen potenziellen Datendiebstahls.

Der Vorwurf gegenüber Unternehmen wie OpenAI, Google und Co.: Die Unternehmen würden für das Training ihrer Sprachmodelle auch Inhalte nutzen, für deren Verwendung sie eigentlich keine Befugnis haben. Das entspräche einem Verstoß gegen das Urheberrecht.

So kannst du den GPTBot für deine Website deaktivieren

OpenAI erklärt deshalb, wie du den GPTBot deaktivieren kannst. Das funktioniert demnach mithilfe einer robots.txt-Datei. Diese verwaltet den Crawler-Traffic auf deiner Website. Um das Crawling zu deaktivieren musst du sie im Root-Verzeichnis deiner Domain ablegen.

Solltest du nicht wollen, dass die KI deine Website crawelt, hast du wiederum zwei Möglichkeiten. Du kannst dich einerseits dazu entscheiden, den Bot komplett zu blockieren. Dafür nutzt du folgenden Code:

User-agent: GPTBot
Disallow: /

Allerdings kannst du GPTBot auch eine Teilerlaubnis geben. Das funktioniert wiederum mit diesem Code:

User-agent: GPTBot
Allow: /directory-1/
Disallow: /directory-2/

Crawling per GPTBot führt zu Problemen

Wie verschiedene User berichten, gibt es allerdings bereits Probleme mit dem GPTBot. Der Crawler habe beispielsweise automatisch 403-Fehlermeldungen für einige Seiten ausgespielt, weil er nicht in der entsprechenden Whitelist aufgeführt war.

Außerdem scheint auch robots.txt in den Augen von Google bereits veraltet zu sein. „[…] robots.txt, wurde vor fast 30 Jahren geschaffen und hat sich als einfache und transparente Möglichkeit für Web-Publisher erwiesen, das Crawlen ihrer Inhalte durch Suchmaschinen zu steuern“, so der Suchmaschinen-Konzern.

Es sei deshalb an der Zeit, dass die Web- und KI-Gemeinschaften weitere maschinenlesbare Mittel zur Auswahl und Kontrolle von Web-Publishern für neue KI- und Forschungsanwendungen erforschen. Wann damit zu rechnen ist, verrät Google bisher nicht.

Auch interessant:

		Social Media Manager (m/w/d) OBO Bettermann Holding GmbH & Co. KG in Menden (Saue...
		Head of Online Marketing (m/w/d) Stellvertret... motoin GmbH in Aachen
		Dualer Master (M.Sc.) Digital Business Manage... Stadtwerke Ludwigsburg Kornwestheim GmbH in Ludwigsburg
		🎨 Grafiker / Video-Content-Creator (m/w/d) 10... Josef Schmelter GmbH Sägewerk in Bundesweit, Berlin,...
		Werkstudent Online-Marketing & Social Med... dfv Mediengruppe (Deutscher Fachv... in Frankfurt am...
		Scala Developer (d/f/m) Risk.Ident GmbH in Hamburg

BASIC thinking UPDATE

GPTBot: Webcrawler in der Kritik

So kannst du den GPTBot für deine Website deaktivieren

Crawling per GPTBot führt zu Problemen

Vodafone Business: iPhone 16 und Galaxy S25 für einmalig 84 Cent sichern

LESEEMPFEHLUNGEN

Withings Days: Exklusive Vorteile für deine Gesundheit

Künstliche Intelligenz verwandelt Haustiere in Menschen

Die größten Technologie-Unternehmen der Welt

Google: Third Party Cookies bleiben! Was das für Nutzer bedeutet

Strom aus Regen: Forscher entwickeln Mini-Kraftwerk für Hausdächer

Für Privathaushalte: KI-Batterie kauft Strom, wenn er besonders günstig ist