Tools / robots.txt-Generator für KI
🚦 Kostenlos und unbegrenzt

robots.txt-Generator für KI-Crawler

Erlauben oder blockieren Sie jeden KI-Crawler in Kenntnis der Sachlage und kopieren Sie anschließend den Block in Ihre robots.txt.

GPTBot und OAI-SearchBot: zwei Entscheidungen, nicht eine

GPTBot sammelt Seiten, um die Modelle von OpenAI zu trainieren. Ihn zu blockieren hat keinerlei Wirkung auf Ihre Präsenz in ChatGPT. OAI-SearchBot dagegen speist den Suchindex von ChatGPT: er entscheidet, ob Ihre Seite abgerufen, zusammengefasst und mit Link zitiert werden kann. Ihn zu blockieren nimmt Sie aus den Antworten von ChatGPT heraus. Viele Websites haben eine Sperre für GPTBot kopiert und OAI-SearchBot „sicherheitshalber“ hinzugefügt und sich damit selbst aus genau dem Traffic-Kanal geschnitten, den sie erschließen wollten. Entscheiden Sie Zeile für Zeile, nicht pauschal.

Voreinstellungen
Öffnet alles, was Sie zitieren kann, schließt die Sammler, die es nie tun.
GPTBot OpenAI Training

Sammelt Seiten für das Training der OpenAI-Modelle.

Ihn zu blockieren nimmt Sie nicht aus den Antworten von ChatGPT. Es ist eine Entscheidung über Ihre Daten, nicht über Ihre Sichtbarkeit.

OAI-SearchBot OpenAI Suche und Zitat

Indexiert Seiten für die Suche von ChatGPT.

Dieser Crawler bestimmt, ob Sie in den Antworten von ChatGPT auftauchen und verlinkt werden. Ihn zu blockieren löscht Sie aus den Zitaten.

OAI-AdsBot OpenAI Werbung

Prüft die Landingpages der Anzeigen von ChatGPT Ads.

Notwendig, wenn Sie Werbung in ChatGPT kaufen wollen: ohne ihn lassen sich Ihre Landingpages nicht validieren.

ChatGPT-User OpenAI Durch Nutzer ausgelöster Abruf

Ruft eine Seite live ab, weil ein Nutzer den Link geteilt oder eine Frage dazu gestellt hat.

Traffic, den eine reale Person in Echtzeit auslöst. Ihn zu blockieren heißt, einen ausdrücklich angefragten Besuch abzuweisen.

ClaudeBot Anthropic Training

Sammelt Seiten für die Claude-Modelle.

Anthropic setzt außerdem Claude-User für die Live-Abrufe und Claude-SearchBot für die Suche ein: das sind eigene Agenten, die eine eigene Entscheidung verlangen.

PerplexityBot Perplexity Suche und Zitat

Indexiert Seiten für die belegten Antworten von Perplexity.

Perplexity zeigt seine Quellen grundsätzlich an. Ihn zu blockieren heißt, auf diese Zitate und den Traffic zu verzichten, der daran hängt.

Google-Extended Google Training

Kennzeichen, das die Nutzung Ihrer Inhalte für Gemini und die Verankerung der Antworten steuert.

Es ist kein Crawler: es ändert weder Ihre Indexierung noch Ihr Ranking in Google Search.

CCBot Common Crawl Training

Baut einen öffentlichen Korpus auf, der in zahlreichen Trainingsläufen wiederverwendet wird.

Kein direkter Gewinn an Sichtbarkeit: Common Crawl zitiert niemanden. Der erste Kandidat für eine Sperre, wenn Sie Ihre Inhalte schützen.

Bytespider ByteDance Training

Sammelt Seiten für die Modelle von ByteDance.

Bekannt für ein aggressives Crawl-Tempo. Viele Websites blockieren ihn ebenso sehr wegen der Serverlast wie aus Rechtegründen.

meta-externalagent Meta Training

Sammelt Seiten für die Modelle von Meta und für Meta AI.

Meta betreibt mehrere Agenten. Dieser hier ist der dokumentierte Crawler für das Training.

Applebot-Extended Apple Training

Kennzeichen, das die Nutzung Ihrer Inhalte für Apple Intelligence steuert.

Es rührt Applebot nicht an, der Siri und Spotlight speist: Ihre Präsenz in der Apple-Suche bleibt unberührt.

Einer pro Zeile. Nützlich für einen Kundenbereich, einen Warenkorb oder eine Testumgebung.
Wird am Dateiende angehängt. Leer lassen, um sie wegzulassen.
Kostenlos, unbegrenzt, ohne Konto

Dieses Tool läuft vollständig in Ihrem Browser. Nichts von dem, was Sie hier eingeben, erreicht unsere Server, nichts wird gespeichert, es gibt kein Konto anzulegen und kein Kontingent zu beachten. Wir können es deshalb ohne Gegenleistung anbieten: es kostet uns nichts.

Was dieses Tool leistet

Eine schlecht eingestellte robots.txt ist der schnellste Weg, unbemerkt aus den KI-Antworten zu verschwinden. Die häufigste und teuerste Verwechslung betrifft OpenAI: GPTBot und OAI-SearchBot machen nicht dieselbe Arbeit, und den einen statt des anderen zu blockieren hat gegenteilige Folgen. Dieses Tool zeigt die tatsächliche Aufgabe jedes Crawlers an, bevor es Sie entscheiden lässt.

  • Elf KI-Crawler abgedeckt, jeder mit seiner tatsächlichen Aufgabe: Training, Suche und Zitat, durch Nutzer ausgelöster Abruf, Werbung.
  • Vier Voreinstellungen, darunter eine, die die Zitate erhält und zugleich die Sammlung für das Training verweigert.
  • Ergänzt gesperrte Pfade, die für die Crawler gelten, die Sie durchlassen, zum Schutz eines Kundenbereichs oder eines Warenkorbs.
  • Hängt am Dateiende eine Sitemap-Zeile an, dazu Kommentare, die an die Aufgabe jedes Crawlers erinnern.
  • Lokale Erzeugung: die Datei entsteht in Ihrem Browser, nichts wird übertragen.

Häufige Fragen

Verschwinde ich aus ChatGPT, wenn ich GPTBot blockiere?
Nein. GPTBot dient dem Training der Modelle. Was Ihre Präsenz in den Antworten von ChatGPT bestimmt, ist OAI-SearchBot, dazu ChatGPT-User für die Live-Abrufe. Sie können das Training ablehnen und trotzdem einwandfrei zitierbar bleiben.
Halten sich die Crawler wirklich an robots.txt?
Die dokumentierten Agenten von OpenAI, Anthropic, Google, Apple und Perplexity geben an, sie zu beachten, und tun es in der Praxis auch. robots.txt bleibt eine Konvention, keine technische Sperre. Wenn Sie einen Zugriff wirklich verhindern müssen, brauchen Sie eine Sperre auf Ebene der Web Application Firewall oder des CDN, abgeglichen mit den veröffentlichten IP-Bereichen.
Wohin gehört diese Datei?
In das Wurzelverzeichnis der Domain, und nur dorthin: https://beispiel.de/robots.txt. Eine Datei in einem Unterverzeichnis wird nie gelesen. Jede Subdomain hat ihre eigene robots.txt.
Kann ich nur einen Teil der Website sperren?
Ja. Das Feld für die gesperrten Pfade fügt jedem Crawler, den Sie zulassen, Disallow-Zeilen hinzu: sie behalten den Zugang zur Website, aber nicht zu diesen Verzeichnissen. Das ist der richtige Weg für einen Kundenbereich oder eine Bestellstrecke.
Wie prüfe ich, ob meine Regeln wirklich greifen?
Sehen Sie in Ihre Server-Logs: sie sagen Ihnen, welche Crawler tatsächlich vorbeikommen und auf welchen Seiten. Genau das leistet unsere Log-Analyse für KI-Crawler, die außerdem unbeabsichtigte Sperren durch die Firewall oder das CDN aufspürt.

Weiter gehen als der Generator

Diese Mikro-Tools erzeugen eine Datei. Die Ready2GEO-Scanner sehen nach, was auf Ihrer Website und in den Antworten der KI-Motoren tatsächlich passiert.

Alle Ready2GEO-Tools