Outils / Générateur robots.txt IA
🚦 Gratuit et illimité

Générateur robots.txt pour les robots IA

Autorisez ou bloquez chaque robot IA en connaissance de cause, puis copiez le bloc à ajouter à votre robots.txt.

GPTBot et OAI-SearchBot : deux décisions, pas une

GPTBot collecte des pages pour entraîner les modèles OpenAI. Le bloquer n'a aucun effet sur votre présence dans ChatGPT. OAI-SearchBot, lui, alimente l'index de recherche de ChatGPT : c'est lui qui décide si votre page peut être récupérée, résumée et citée avec un lien. Le bloquer vous retire des réponses de ChatGPT. Beaucoup de sites ont copié un blocage de GPTBot en y ajoutant OAI-SearchBot « par sécurité », et se sont éliminés eux-mêmes du canal de trafic qu'ils cherchaient à travailler. Décidez ligne par ligne, pas en bloc.

Préréglages
Ouvre tout ce qui peut vous citer, ferme les collecteurs qui ne citent jamais.
GPTBot OpenAI Entraînement

Collecte des pages pour l'entraînement des modèles OpenAI.

Le bloquer ne vous retire pas des réponses de ChatGPT. C'est une décision sur vos données, pas sur votre visibilité.

OAI-SearchBot OpenAI Recherche et citation

Indexe les pages pour la recherche de ChatGPT.

C'est ce robot qui conditionne votre présence et votre lien dans les réponses ChatGPT. Le bloquer vous supprime des citations.

OAI-AdsBot OpenAI Publicité

Contrôle les pages de destination des annonces ChatGPT Ads.

Nécessaire si vous comptez acheter de la publicité dans ChatGPT : sans lui, vos pages de destination ne peuvent pas être validées.

ChatGPT-User OpenAI Visite déclenchée par un utilisateur

Va chercher une page en direct parce qu'un utilisateur a partagé le lien ou posé une question dessus.

Trafic déclenché par une personne réelle, en temps réel. Le bloquer revient à refuser une visite demandée explicitement.

ClaudeBot Anthropic Entraînement

Collecte des pages pour les modèles Claude.

Anthropic utilise aussi Claude-User pour les récupérations en direct et Claude-SearchBot pour la recherche : ce sont des agents distincts, à traiter séparément.

PerplexityBot Perplexity Recherche et citation

Indexe les pages pour les réponses sourcées de Perplexity.

Perplexity affiche systématiquement ses sources. Le bloquer, c'est renoncer à ces citations et au trafic qui va avec.

Google-Extended Google Entraînement

Jeton qui contrôle l'usage de votre contenu pour Gemini et l'ancrage des réponses.

Ce n'est pas un robot d'exploration : il ne change ni votre indexation ni votre classement dans Google Search.

CCBot Common Crawl Entraînement

Constitue un corpus public réutilisé par de nombreux entraînements.

Aucun bénéfice direct de visibilité : Common Crawl ne cite personne. C'est le premier candidat au blocage si vous protégez vos données.

Bytespider ByteDance Entraînement

Collecte des pages pour les modèles de ByteDance.

Réputé pour un rythme de crawl agressif. Beaucoup de sites le bloquent pour des raisons de charge serveur autant que de droits.

meta-externalagent Meta Entraînement

Collecte des pages pour les modèles de Meta et Meta AI.

Meta utilise plusieurs agents. Celui-ci est l'agent d'exploration documenté pour l'entraînement.

Applebot-Extended Apple Entraînement

Jeton qui contrôle l'usage de votre contenu pour Apple Intelligence.

Il ne touche pas à Applebot, qui alimente Siri et Spotlight : votre présence dans la recherche Apple n'est pas affectée.

Un par ligne. Utile pour un espace client, un panier ou une zone de test.
Ajoutée en fin de fichier. Laissez vide pour l'omettre.
Gratuit, illimité, sans compte

Cet outil tourne entièrement dans votre navigateur. Aucune donnée saisie ici ne part sur nos serveurs, rien n'est enregistré, et il n'y a ni compte à créer ni quota à respecter. Nous pouvons donc l'offrir sans contrepartie : il ne nous coûte rien.

Ce que fait cet outil

Un robots.txt mal calibré est la façon la plus rapide de disparaître des réponses IA sans s'en rendre compte. La confusion la plus fréquente et la plus coûteuse concerne OpenAI : GPTBot et OAI-SearchBot ne font pas le même travail, et bloquer l'un pour l'autre a des conséquences opposées. Cet outil affiche le rôle réel de chaque robot avant de vous laisser trancher.

  • Onze robots IA couverts, chacun avec son rôle réel : entraînement, recherche et citation, visite déclenchée par un utilisateur, publicité.
  • Quatre préréglages, dont un qui garde les citations tout en refusant la collecte d'entraînement.
  • Ajout de chemins interdits qui s'appliquent aux robots que vous laissez passer, pour protéger un espace client ou un panier.
  • Ligne Sitemap ajoutée en fin de fichier, et commentaires qui rappellent le rôle de chaque robot.
  • Génération locale : le fichier est fabriqué dans votre navigateur, rien n'est transmis.

Questions fréquentes

Bloquer GPTBot me fait-il disparaître de ChatGPT ?
Non. GPTBot sert à l'entraînement des modèles. Ce qui conditionne votre présence dans les réponses de ChatGPT, c'est OAI-SearchBot, plus ChatGPT-User pour les récupérations en direct. Vous pouvez parfaitement refuser l'entraînement tout en restant citable.
Les robots respectent-ils vraiment robots.txt ?
Les agents documentés d'OpenAI, Anthropic, Google, Apple et Perplexity annoncent le respecter, et le font en pratique. robots.txt reste une convention, pas une barrière technique. Si vous devez réellement empêcher un accès, il faut un blocage au niveau du pare-feu applicatif ou du CDN, avec vérification des plages d'adresses IP publiées.
Où placer ce fichier ?
À la racine du domaine, et uniquement là : https://exemple.com/robots.txt. Un fichier posé dans un sous-répertoire n'est jamais lu. Chaque sous-domaine a son propre robots.txt.
Puis-je bloquer une partie du site seulement ?
Oui. Le champ des chemins interdits ajoute des lignes Disallow à chaque robot que vous laissez autorisé : ils gardent l'accès au site mais pas à ces répertoires. C'est la bonne approche pour un espace client ou un tunnel de commande.
Comment vérifier que mes règles sont appliquées ?
Regardez vos logs serveur : ce sont eux qui disent quels robots passent réellement et sur quoi. C'est exactement le travail de notre analyseur de logs crawlers IA, qui repère aussi les blocages involontaires par le pare-feu ou le CDN.

Aller plus loin que le générateur

Ces micro-outils produisent un fichier. Les scanners Ready2GEO, eux, vont chercher ce qui se passe réellement sur votre site et dans les réponses des moteurs IA.

Tous les outils Ready2GEO