KI-Crawler in der robots.txt: Wer zugreift und was zu beachten ist
Die robots.txt entscheidet darüber, ob KI-Systeme eine Website lesen dürfen. Weil viele Vorlagen aus dem Netz KI-Crawler pauschal sperren, geschieht der Ausschluss oft unbeabsichtigt.
Die wichtigsten Crawler
Die Anbieter setzen unterschiedliche Bots für unterschiedliche Zwecke ein. Die Unterscheidung ist wichtig, weil sie eine bewusste Entscheidung erlaubt.
| Bot | Anbieter | Zweck |
|---|---|---|
| GPTBot | OpenAI | Erfassung für Modelltraining |
| OAI-SearchBot | OpenAI | Indexierung für die Suchfunktion |
| ChatGPT-User | OpenAI | Abruf während einer Nutzeranfrage |
| ClaudeBot | Anthropic | Erfassung für Modelltraining |
| Claude-User | Anthropic | Abruf während einer Nutzeranfrage |
| PerplexityBot | Perplexity | Indexierung für die Antwortsuche |
| Google-Extended | Steuert die Nutzung für generative Antworten |
Die Unterscheidung Training und Antwort
Manche Unternehmen möchten ihre Inhalte nicht für Modelltraining freigeben, in Antworten aber genannt werden. Diese Unterscheidung lässt sich abbilden, weil Trainings- und Abrufbots getrennt adressierbar sind. Wer beispielsweise GPTBot sperrt, OAI-SearchBot und ChatGPT-User aber zulässt, bleibt in der Suchfunktion sichtbar.
Zu bedenken ist, dass Trainingswissen langfristig wirkt. Eine Marke, die nie in Trainingsdaten auftaucht, ist bei Fragen ohne Websuche schlechter aufgestellt.
Eine Beispielkonfiguration
Diese Variante erlaubt allen genannten Systemen den Zugriff.
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
Sitemap: https://ihre-domain.de/sitemap.xml
Was die robots.txt nicht leistet
Sie ist eine Anweisung, keine technische Sperre. Seriöse Anbieter halten sich daran, garantiert ist es nicht. Wer Inhalte sicher schützen will, braucht Zugangsbeschränkungen statt Ausschlussregeln.
Umgekehrt bedeutet eine erlaubte robots.txt nicht automatisch Sichtbarkeit. Sie ist die Voraussetzung, nicht die Ursache. Welche weiteren Faktoren wirken, steht unter Sichtbarkeit verbessern.
Prüfung in fünf Minuten
- Die eigene robots.txt aufrufen, erreichbar unter
ihre-domain.de/robots.txt. - Nach den oben genannten Bot-Namen suchen und prüfen, ob dort
Disallow: /steht. - Prüfen, ob eine pauschale Regel für alle Bots den Zugriff einschränkt.
- Bei Bedarf anpassen und die Sitemap-Angabe ergänzen.
Wo steht Ihre Firma in den KI-Antworten?
Der kostenlose Kurz-Check zeigt es Ihnen sofort. Der vollständige Report kostet 9,99 €.
Sofort einsehen →