KI-Crawler und robots.txt: wen erlauben?

Es gibt zwei Arten von KI-Crawlern. Antwort-Bots rufen Seiten ab, um sie zu zitieren; Trainings-Bots kopieren Text, um Modelle zu trainieren. Behandeln Sie beide getrennt, und verwechseln Sie keinen von beiden mit Googlebot.

Die kurze Antwort

Erlauben Sie die Antwort-Bots, wenn Sie in KI-Antworten vorkommen wollen. Entscheiden Sie über die Trainings-Bots nach Ihren eigenen Maßstäben; sie zu sperren hält Ihren Text aus künftigen Modellen, entfernt Sie aber nicht aus Antworten. Lassen Sie Googlebot in Ruhe.

Die Bots, nach dem, was sie tun

Crawler Betreiber Verwendet für
OAI-SearchBot OpenAI ChatGPT-Suchergebnisse und Zitate (Antworten)
ChatGPT-User OpenAI Seiten, nach denen ein ChatGPT-Nutzer fragt, live abgerufen (Antworten)
GPTBot OpenAI Trainingsdaten (Training)
Claude-User Anthropic Seiten, nach denen ein Claude-Nutzer fragt, live abgerufen (Antworten)
ClaudeBot Anthropic Trainingsdaten und Claude-Webantworten (Training + Antworten)
PerplexityBot Perplexity Perplexity-Index und Zitate (Antworten)
Google-Extended Google Gemini-Training und -Grounding, nicht Google-Suche (Training)
Applebot-Extended Apple Apple-Intelligence-Training (Training)

Die Zeilen

Antwort-Bots erlauben und Trainings-Bots sperren:

User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /
User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /

ClaudeBot ist der Sonderfall: Er dient sowohl dem Training als auch Claudes Webantworten, eine Sperre entfernt Sie also auch aus diesen Antworten.

Prüfen, bevor Sie ändern

Lesen Sie zuerst Ihre robots.txt: Eine User-agent: *-Regel gilt bereits für jeden Bot, den Sie nicht genannt haben. Eine Website, die durch eine Staging-Regel alles sperrt, sperrt auch die Antwort-Bots, und nichts in der Search Console wird es Ihnen sagen.

MonoRanks liest die Datei, zeigt die Wirkung je Bot und gibt Ihnen die genauen Zeilen für Ihre Wahl; auf WordPress kann es sie für Sie schreiben. Siehe GEO-Bereitschaft.

Quellen

Häufige Fragen

Schadet es meinen Google-Rankings, GPTBot zu sperren?

Nein. GPTBot ist der Trainings-Crawler von OpenAI; die Google-Suche nutzt Googlebot, den diese Regeln nicht berühren.

Was ist Google-Extended?

Eine Steuerung dafür, ob Google Ihre Seiten für Gemini-Training und -Grounding nutzen darf. Sie betrifft weder die Google-Suche noch AI Overviews.

Halten sich alle Bots an die robots.txt?

Die genannten von OpenAI, Anthropic, Google, Apple und Perplexity sagen, dass sie es tun. Unbekannte Scraper vielleicht nicht; das ist eine Firewall-Frage, keine robots.txt-Frage.

Etwa eine E-Mail im Monat

Was sich bei Suche und KI-Antworten geändert hat, aus dem, was wir in Audits sehen. Keine Karte, kein Verkaufsgespräch, Abmelden mit einem Klick.