Technik10 Min. Lesezeit

KI-Crawler & robots.txt: GPTBot, ClaudeBot, PerplexityBot richtig steuern

Zuletzt aktualisiert: · Autor: Bleron Berisha, Geschäftsführer

Inhalt

Ob Ihr Unternehmen in ChatGPT, Claude oder Perplexity als Quelle auftaucht, hängt auch an einer kleinen Textdatei: der robots.txt. Darin legen Sie fest, welche KI-Crawler Ihre Website lesen dürfen. Viele Anleitungen im Netz drehen sich vor allem ums Blockieren. Eine pauschale Sperre kann Sie aber aus KI-Antworten ausschließen, ohne dass Sie es merken. Dieser Artikel zeigt, welche Bots es gibt, wofür sie da sind und wie Sie GPTBot, ClaudeBot, PerplexityBot und die anderen gezielt steuern. Alle Angaben beruhen auf der Dokumentation der Anbieter, Stand: Oktober 2026.

Was sind KI-Crawler?

Ein Crawler (auch Bot genannt) ist ein Programm, das automatisch Webseiten abruft. KI-Crawler sind die Crawler von KI-Anbietern. Entscheidend ist: Hinter einem Anbieter stehen meist mehrere Bots mit unterschiedlichem Zweck. Sie lassen sich in drei Gruppen einteilen:

  • Trainings-Crawler sammeln Texte, mit denen künftige Sprachmodelle trainiert werden. Beispiele: GPTBot von OpenAI, ClaudeBot von Anthropic.
  • Such-Crawler bauen einen Index auf, also ein Verzeichnis erfasster Seiten, aus dem ein KI-Assistent bei einer Frage aktuelle Quellen auswählt und verlinkt. Beispiele: OAI-SearchBot für die Suche in ChatGPT, PerplexityBot.
  • Nutzer-Abrufe entstehen, wenn jemand im Chat nach einer bestimmten Seite fragt oder einen Link teilt. Der Assistent ruft die Seite dann einmalig ab. Beispiele: ChatGPT-User, Claude-User, Perplexity-User.

Diese Trennung ist der Schlüssel zu allem Weiteren. Wer GPTBot sperrt, untersagt nach Angaben von OpenAI die Nutzung für das Training, nicht die Anzeige in der ChatGPT-Suche. Dafür ist der OAI-SearchBot zuständig.

Die robots.txt selbst ist eine einfache Textdatei im Hauptverzeichnis Ihrer Domain, zum Beispiel ihre-domain.de/robots.txt. Sie besteht aus Gruppen: Eine oder mehrere Zeilen User-agent nennen den Bot, darunter folgen Allow-Regeln (erlaubt) und Disallow-Regeln (gesperrt) für Pfade.

Die wichtigsten KI-Crawler im Überblick

Die Tabelle fasst die offiziellen Angaben der Anbieter zusammen (Stand: Oktober 2026). Die Namen in der zweiten Spalte verwenden Sie genau so in der robots.txt.

AnbieterName in der robots.txtZweckBefolgt die robots.txt?
OpenAIGPTBotTraining der Modelleja
OpenAIOAI-SearchBotSuche in ChatGPTja, Änderung wirkt nach etwa 24 Stunden
OpenAIChatGPT-UserAbruf auf Nutzerwunschlaut OpenAI nicht zwingend
AnthropicClaudeBotTraining der Modelleja
AnthropicClaude-SearchBotSuche in Claudeja
AnthropicClaude-UserAbruf auf Nutzerwunschja
PerplexityPerplexityBotSuche in Perplexity, kein Trainingja, Änderung wirkt nach bis zu 24 Stunden
PerplexityPerplexity-UserAbruf auf Nutzerwunschin der Regel nein
GoogleGoogle-ExtendedGemini-Training und Grounding (kein eigener Crawler)ja, Googlebot beachtet den Eintrag
AppleApplebot-ExtendedTraining der Apple-Modelle (kein eigener Crawler)ja, Applebot beachtet den Eintrag

OpenAI: GPTBot, OAI-SearchBot und ChatGPT-User

In der Übersicht der OpenAI-Crawler beschreibt OpenAI die Einstellungen ausdrücklich als unabhängig voneinander. Das Beispiel aus der Doku ist genau der Fall, den viele Unternehmen wollen: OAI-SearchBot erlauben, um in Suchergebnissen zu erscheinen, und GPTBot sperren, damit Inhalte nicht ins Training fließen. Seiten, die den OAI-SearchBot aussperren, zeigt ChatGPT laut OpenAI nicht in Suchantworten, höchstens noch als reinen Navigationslink. OpenAI empfiehlt, den OAI-SearchBot zuzulassen und auch seine veröffentlichten IP-Adressen nicht zu blockieren.

ChatGPT-User ist kein Crawler im engeren Sinn. Er ruft eine Seite ab, wenn ein Nutzer in ChatGPT danach fragt. Weil die Aktion vom Nutzer ausgeht, gelten robots.txt-Regeln laut OpenAI möglicherweise nicht. Über die Aufnahme in die Suche entscheidet ChatGPT-User nicht. Ein vierter Bot, OAI-AdsBot, besucht nur Zielseiten von Anzeigen, die in ChatGPT eingereicht wurden. Für die meisten Unternehmen spielt er keine Rolle.

Anthropic: ClaudeBot, Claude-SearchBot und Claude-User

Anthropic nutzt laut Claude Help Center drei Bots. ClaudeBot sammelt Inhalte für das Modelltraining. Eine Sperre bedeutet, dass künftige Inhalte Ihrer Seite aus den Trainingsdaten ausgeschlossen werden. Claude-SearchBot indexiert Inhalte für die Suche; wer ihn sperrt, riskiert laut Anthropic weniger Sichtbarkeit in den Suchergebnissen von Claude. Claude-User ruft Seiten bei Nutzerfragen ab.

Anthropic gibt an, dass seine Bots die robots.txt beachten. Zusätzlich wird die Angabe Crawl-delay unterstützt, mit der Sie die Abrufgeschwindigkeit drosseln. Zwei praktische Hinweise aus der Doku: Die Sperre gilt je Subdomain, ein Shop unter shop.ihre-domain.de braucht also eine eigene robots.txt. Und eine Sperre über IP-Adressen ist laut Anthropic nicht verlässlich, weil der Bot dann auch Ihre robots.txt nicht mehr lesen kann. Ältere Namen wie anthropic-ai oder Claude-Web stehen nicht mehr in der aktuellen Doku. Verlassen Sie sich nicht darauf.

Perplexity: PerplexityBot und Perplexity-User

PerplexityBot dient laut Perplexity-Dokumentation dazu, Websites in den Suchergebnissen von Perplexity anzuzeigen und zu verlinken. Für das Training von KI-Basismodellen wird er nach Angaben des Anbieters nicht genutzt. Änderungen an der robots.txt greifen bis zu 24 Stunden später. Perplexity-User besucht Seiten, wenn ein Nutzer eine Frage stellt, und ignoriert die robots.txt dabei in der Regel. Für Firewalls (WAF, Web Application Firewall) liefert Perplexity eigene Anleitungen, etwa für Cloudflare und AWS. Die Empfehlung: User-Agent und IP-Adresse kombiniert prüfen.

Google und Apple: Steuerungs-Einträge statt eigener Bots

Google-Extended und Applebot-Extended sind keine eigenen Crawler. Es sind Namen, mit denen Sie in der robots.txt eine bestimmte Nutzung untersagen. Gecrawlt wird weiter mit Googlebot beziehungsweise Applebot.

  • Google-Extended steuert laut Google Search Central, ob Inhalte für das Training künftiger Gemini-Modelle und für das sogenannte Grounding in der Gemini-App und auf Vertex AI genutzt werden. Grounding heißt: Das Modell bekommt bei einer Frage aktuelle Inhalte aus dem Google-Index zugespielt. Google-Extended beeinflusst weder die Aufnahme in die Google-Suche noch das Ranking.
  • Applebot-Extended untersagt laut Apple das Training der Apple-Basismodelle. Seiten mit dieser Sperre können weiter in Apples Suche erscheinen, also in Spotlight, Siri und Safari. Gut zu wissen: Nennt Ihre robots.txt Applebot nicht, folgt Apple den Regeln für Googlebot.

Und die KI-Übersichten in der Google-Suche? AI Overviews und der KI-Modus nutzen den normalen Googlebot, einen eigenen KI-Crawler gibt es dafür nicht. Ausschließen können Sie Ihre Website seit dem 31. August 2026 weltweit über die Search-Console-Einstellung „Search generative AI control“, die laut Google-Hilfe kein Rankingsignal ist und in der Regel nach einigen Tagen vollständig greift. Was das für Unternehmen bedeutet, steht im Ratgeber Google AI Overviews und AI Mode.

KI-Crawler blockieren oder erlauben?

Eine pauschal richtige Antwort gibt es nicht, aber eine klare Faustregel: Such-Crawler erlauben, beim Training bewusst entscheiden.

Die Such-Crawler OAI-SearchBot, Claude-SearchBot und PerplexityBot sind die Voraussetzung dafür, dass ein KI-Assistent Ihre Seite als aktuelle Quelle nennen und verlinken kann. Für einen Handwerksbetrieb, eine Kanzlei oder ein Softwarehaus, das neue Kunden gewinnen will, ist eine Sperre dieser Bots fast immer ein Eigentor.

Beim Training ist die Abwägung offener. Dafür spricht: Was im Training steckt, kann ein Modell auch ohne Websuche über Ihr Unternehmen wissen. Wie stark das die Nennung in Antworten beeinflusst, hat allerdings kein Anbieter offengelegt. Dagegen spricht: Sie geben Inhalte für ein Produkt frei, an dem Sie nicht beteiligt sind. Für Verlage, Fachdatenbanken oder Anbieter kostenpflichtiger Inhalte wiegt das schwerer als für einen Betrieb, dessen Website vor allem Leistungen, Referenzen und Kontaktdaten zeigt.

Diese vier Fragen helfen bei der Entscheidung:

  1. Lebt Ihr Geschäft davon, gefunden zu werden? Dann Such-Crawler und Nutzer-Abrufe auf jeden Fall erlauben.
  2. Ist Ihr Inhalt selbst das Produkt, etwa Fachartikel hinter einer Bezahlschranke, Datenbanken oder Kurse? Dann Trainings-Crawler eher sperren und bezahlte Bereiche ohnehin per Login schützen.
  3. Ist Gemini für Sie ein Kanal? Bedenken Sie, dass Google-Extended neben dem Training auch das Grounding in der Gemini-App betrifft.
  4. Wer entscheidet? Training freigeben oder nicht ist eine Geschäftsentscheidung, keine reine IT-Frage. Klären Sie sie mit der Geschäftsführung und halten Sie das Ergebnis schriftlich fest.

Ob ein Nutzungsvorbehalt in der robots.txt urheberrechtlich ausreicht, behandelt dieser Artikel bewusst nicht. Lassen Sie solche Fragen bei Bedarf anwaltlich prüfen.

Drei fertige robots.txt-Vorlagen

Die folgenden Beispiele können Sie übernehmen. Ersetzen Sie /admin/ durch die Bereiche, die bei Ihnen ohnehin nicht in Suchmaschinen gehören (Login, Warenkorb, interne Suche), und passen Sie die Domain in der Sitemap-Zeile an.

Vorlage A: Maximale Sichtbarkeit

Alle Bots dürfen alles lesen, außer den gesperrten Verwaltungsbereichen.

User-agent: *
Disallow: /admin/

User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: Applebot-Extended
Allow: /
Disallow: /admin/

Sitemap: https://www.ihre-domain.de/sitemap.xml

Technisch wäre die lange Liste nicht nötig, denn Bots ohne eigene Gruppe folgen der Gruppe mit dem Sternchen. Die ausdrückliche Nennung dokumentiert aber Ihre Entscheidung. Wichtig ist nur, dass auch diese Gruppe die Disallow-Zeilen enthält. Warum, steht weiter unten bei den typischen Fehlern.

Vorlage B: Training aus, Suche an

Die Variante für alle, die in KI-Suchen sichtbar bleiben, aber keine Inhalte für das Modelltraining freigeben wollen.

User-agent: *
Disallow: /admin/

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Applebot-Extended
Disallow: /

User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Allow: /
Disallow: /admin/

Sitemap: https://www.ihre-domain.de/sitemap.xml

Die erste benannte Gruppe untersagt das Training, die zweite erlaubt die Such-Crawler. Die Nutzer-Abrufe (ChatGPT-User, Claude-User, Perplexity-User) haben hier keine eigene Gruppe und folgen damit der Sternchen-Gruppe. Google-Extended fehlt bewusst: Wer auch das Gemini-Training ausschließen will, ergänzt User-agent: Google-Extended in der ersten Gruppe. Das schließt dann aber auch das Grounding in der Gemini-App aus.

Vorlage C: Alle KI-Crawler sperren

User-agent: *
Disallow: /admin/

User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /

Die Folgen sollten Sie kennen: Ihre Seite erscheint nicht mehr in den Suchantworten von ChatGPT (höchstens als Navigationslink), und die Suchfunktionen von Claude und Perplexity können sie kaum noch als Quelle nutzen. Nutzer-Abrufe von ChatGPT und Perplexity können trotzdem stattfinden, weil diese die robots.txt laut Anbieter nicht zwingend beachten. Die KI-Übersichten von Google bleiben unberührt, solange Googlebot erlaubt ist. Googlebot selbst sperren Sie bitte nie, wenn Sie bei Google gefunden werden wollen.

Typische Fehler bei der robots.txt für KI-Bots

  1. Eigene Gruppe ohne Sperren. Nach dem Standard RFC 9309 befolgt ein Crawler nur die Gruppe, die seinen Namen trägt. Die Sternchen-Gruppe gilt für ihn nur, wenn es keine passende Gruppe gibt. Wer also User-agent: GPTBot mit Allow: / anlegt, hebt für GPTBot unbemerkt alle Sperren aus der Sternchen-Gruppe auf. Wiederholen Sie deshalb in jeder Gruppe die nötigen Disallow-Zeilen.
  2. Firewall oder CDN blockiert, obwohl die robots.txt erlaubt. Viele Websites laufen hinter einem CDN (Content Delivery Network) wie Cloudflare. Cloudflare hat am 1. Juli 2025 angekündigt, KI-Crawler ohne Erlaubnis standardmäßig zu blockieren; neue Domains werden bei der Anmeldung gefragt, ob sie KI-Crawler zulassen. Ist eine solche Sperre aktiv, hilft die beste robots.txt nichts. Prüfen Sie deshalb, wie die Bot-Einstellungen bei Ihrem Hoster und CDN heute konkret gesetzt sind.
  3. Subdomains vergessen. Jede Subdomain braucht ihre eigene robots.txt, also auch Shop, Blog oder Karriereportal.
  4. Tippfehler im Namen. Groß- und Kleinschreibung spielt bei den Bot-Namen laut RFC 9309 keine Rolle, ein Tippfehler wie GPT-Bot oder ClaudBot greift aber ins Leere. Bei Pfaden zählt die Schreibweise dagegen.
  5. Sofortige Wirkung erwartet. OpenAI nennt für die Suche etwa 24 Stunden, Perplexity bis zu 24 Stunden. Der Standard erlaubt Crawlern ohnehin, die robots.txt bis zu 24 Stunden zwischenzuspeichern.
  6. Die robots.txt für einen Schutz halten. RFC 9309 stellt klar, dass die Regeln keine Form der Zugriffsberechtigung sind. Zudem kann jeder die Datei lesen. Nennen Sie dort also keine vertraulichen Pfade; was geheim bleiben soll, gehört hinter einen Login.

So prüfen Sie, ob Ihre Einstellungen wirken

Eine robots.txt ist schnell geschrieben, aber erst die Kontrolle zeigt, ob sie tut, was sie soll. Diese Checkliste können Sie mit Ihrem Webdienstleister durchgehen:

  • ihre-domain.de/robots.txt im Browser aufrufen: Lädt die Datei fehlerfrei und ist sie aktuell?
  • Für jeden gewünschten Bot prüfen, welche Gruppe für ihn gilt und ob sie die nötigen Sperren enthält.
  • In der Google Search Console den robots.txt-Bericht öffnen, Fehler prüfen und nach Änderungen ein erneutes Crawlen beantragen.
  • Bot-Schutz und Firewall-Regeln bei Hoster und CDN kontrollieren, auch Schalter wie „KI-Crawler blockieren“.
  • Server-Logs nach den Bot-Namen durchsuchen. Das sind Protokolldateien, in denen der Server jeden Abruf festhält; Ihr Hoster stellt sie meist bereit. Ein einfacher Befehl dafür: grep -E "OAI-SearchBot|GPTBot|ClaudeBot|Claude-SearchBot|PerplexityBot" access.log
  • Auffällige Zugriffe mit den IP-Listen der Anbieter abgleichen, denn Bot-Namen lassen sich fälschen.
  • Eine Wiedervorlage im Kalender setzen: Alle paar Monate prüfen, ob Anbieter neue Bots dokumentiert haben.

Was die robots.txt nicht leistet

Die robots.txt öffnet oder schließt eine Tür. Sie sorgt nicht dafür, dass jemand hErlaubt heißt nicht empfohlen. Im KI-Sichtbarkeits-Audit eines Solar-Fachbetriebs (Juli 2026) war kein KI-Crawler gesperrt, und der Betrieb kam in KI-Antworten trotzdem kaum vor. Die richtige robots.txt ist also Voraussetzung, nicht Hebel., nicht Hebel.

Erlaubt heißt nicht gelesen. Viele KI-Crawler führen kein JavaScript aus. Das hat eine Auswertung von Vercel für die Crawler von OpenAI, Anthropic und Perplexity gemessen (Stand: Dezember 2024, neuere Messungen fehlen). Baut Ihre Website die Inhalte erst im Browser per JavaScript auf, sieht ein solcher Bot unter Umständen eine fast leere Seite. Wichtige Texte gehören deshalb direkt ins ausgelieferte HTML.

robots.txt ist nicht llms.txt. Die robots.txt regelt den Zugriff. Eine llms.txt ist dagegen eine kuratierte Inhaltsübersicht für KI-Agenten, für die bisher kein Effekt auf Rankings oder KI-Antworten belegt ist. Mehr dazu im Ratgeber llms.txt erklärt.

Wie wir das selbst handhaben: Auf ar-ki.info lassen wir alle KI-Crawler aus der Tabelle oben zu, auch die Trainings-Crawler, weil unsere Inhalte gelesen und zitiert werden sollen. Im KI-Sichtbarkeits-Audit prüft AR-KI robots.txt, Firewall-Einstellungen und Server-Logs zusammen mit Inhalten und Drittquellen. Die Umsetzung gehört bei uns zum technischen SEO.

Quellen

  1. OpenAI: Overview of OpenAI Crawlers
  2. Anthropic (Claude Help Center): Does Anthropic crawl data from the web, and how can site owners block the crawler?
  3. Perplexity Docs: Perplexity Crawlers
  4. Google Search Central: Google's common crawlers (Google-Extended)
  5. Google Search Console-Hilfe: Search generative AI control
  6. Apple Support: About Applebot
  7. IETF RFC 9309: Robots Exclusion Protocol
  8. Cloudflare: Pressemitteilung zur Standard-Blockade von KI-Crawlern (1. Juli 2025)

Häufige Fragen

Wie blockiere ich GPTBot in der robots.txt?

Mit zwei Zeilen: User-agent: GPTBot und darunter Disallow: /. Damit signalisieren Sie OpenAI, dass Ihre Inhalte nicht für das Training der Modelle genutzt werden sollen. In der ChatGPT-Suche bleiben Sie sichtbar, solange Sie den OAI-SearchBot nicht ebenfalls sperren.

Was ist der Unterschied zwischen GPTBot, OAI-SearchBot und ChatGPT-User?

GPTBot sammelt Inhalte für das Training der OpenAI-Modelle. OAI-SearchBot baut den Index für die Suche in ChatGPT auf und entscheidet damit, ob Ihre Seite in Suchantworten erscheinen kann. ChatGPT-User ruft eine Seite nur ab, wenn ein Nutzer im Chat danach fragt. Für diese Abrufe gelten robots.txt-Regeln laut OpenAI möglicherweise nicht.

Schadet das Blockieren von KI-Crawlern meiner Sichtbarkeit in ChatGPT?

Das hängt vom Bot ab. Wer OAI-SearchBot sperrt, erscheint laut OpenAI nicht mehr in den Suchantworten von ChatGPT, höchstens noch als Navigationslink. Eine Sperre von GPTBot betrifft dagegen nur das Training. Ob sie sich langfristig darauf auswirkt, was die Modelle über Ihr Unternehmen wissen, hat OpenAI nicht offengelegt.

Halten sich alle KI-Crawler an die robots.txt?

Nicht zwingend. Die robots.txt ist nach dem Standard RFC 9309 eine Bitte und kein Zugriffsschutz. OpenAI, Anthropic und Perplexity geben an, dass ihre Crawler sie befolgen. Bei Abrufen auf Nutzerwunsch ist das anders: ChatGPT-User und Perplexity-User halten sich laut Anbieter nicht unbedingt daran, Claude-User nach Angaben von Anthropic schon.

Beeinflusst Google-Extended mein Google-Ranking?

Nein. Laut Google wirkt Google-Extended weder auf die Aufnahme in die Google-Suche noch auf das Ranking. Der Eintrag steuert, ob Inhalte für das Training von Gemini-Modellen und für das Grounding in der Gemini-App genutzt werden. Für AI Overviews und den KI-Modus der Google-Suche gibt es seit dem 31. August 2026 eine eigene Einstellung in der Search Console.

Wie erkenne ich, ob KI-Crawler meine Website besuchen?

In den Server-Logs (Access-Logs), die Ihr Hoster meist bereitstellt. Suchen Sie dort nach Namen wie GPTBot, OAI-SearchBot, ClaudeBot oder PerplexityBot. Weil sich solche Namen fälschen lassen, gleichen Sie auffällige Zugriffe mit den IP-Listen ab, die OpenAI, Anthropic und Perplexity veröffentlichen.

Wie sichtbar ist Ihr Unternehmen in KI-Antworten?

Im kostenlosen Erstgespräch schauen wir uns an, wie Google und KI-Assistenten Ihr Unternehmen heute darstellen.

30 Minuten, kostenlos und unverbindlich.