Herramientas / Generador de robots.txt para IA
🚦 Gratuito e ilimitado

Generador de robots.txt para los robots de IA

Autoriza o bloquea cada robot de IA con conocimiento de causa, y copia después el bloque que hay que añadir a tu robots.txt.

GPTBot y OAI-SearchBot: dos decisiones, no una

GPTBot recoge páginas para entrenar los modelos de OpenAI. Bloquearlo no tiene ningún efecto sobre tu presencia en ChatGPT. OAI-SearchBot, en cambio, alimenta el índice de búsqueda de ChatGPT: es él quien decide si tu página puede recuperarse, resumirse y citarse con un enlace. Bloquearlo te saca de las respuestas de ChatGPT. Muchos sitios copiaron un bloqueo de GPTBot y le añadieron OAI-SearchBot «por seguridad», y se eliminaron ellos mismos del canal de tráfico que intentaban trabajar. Decide línea por línea, no en bloque.

Preajustes
Abre todo lo que puede citarte y cierra los recolectores que no citan nunca.
GPTBot OpenAI Entrenamiento

Recoge páginas para el entrenamiento de los modelos de OpenAI.

Bloquearlo no te saca de las respuestas de ChatGPT. Es una decisión sobre tus datos, no sobre tu visibilidad.

OAI-SearchBot OpenAI Búsqueda y cita

Indexa las páginas para la búsqueda de ChatGPT.

Es este robot el que condiciona tu presencia y tu enlace en las respuestas de ChatGPT. Bloquearlo te elimina de las citas.

OAI-AdsBot OpenAI Publicidad

Controla las páginas de destino de los anuncios de ChatGPT Ads.

Necesario si piensas comprar publicidad dentro de ChatGPT: sin él, tus páginas de destino no se pueden validar.

ChatGPT-User OpenAI Visita provocada por un usuario

Va a buscar una página en directo porque un usuario ha compartido el enlace o ha hecho una pregunta sobre ella.

Tráfico provocado por una persona real, en tiempo real. Bloquearlo equivale a rechazar una visita solicitada de forma explícita.

ClaudeBot Anthropic Entrenamiento

Recoge páginas para los modelos Claude.

Anthropic usa también Claude-User para las recuperaciones en directo y Claude-SearchBot para la búsqueda: son agentes distintos y hay que tratarlos por separado.

PerplexityBot Perplexity Búsqueda y cita

Indexa las páginas para las respuestas con fuentes de Perplexity.

Perplexity muestra siempre sus fuentes. Bloquearlo es renunciar a esas citas y al tráfico que llevan asociado.

Google-Extended Google Entrenamiento

Token que controla el uso de tu contenido para Gemini y el anclaje de las respuestas.

No es un robot de rastreo: no cambia ni tu indexación ni tu posición en Google Search.

CCBot Common Crawl Entrenamiento

Construye un corpus público reutilizado por numerosos entrenamientos.

Ningún beneficio directo de visibilidad: Common Crawl no cita a nadie. Es el primer candidato al bloqueo si estás protegiendo tus contenidos.

Bytespider ByteDance Entrenamiento

Recoge páginas para los modelos de ByteDance.

Tiene fama de rastrear a un ritmo agresivo. Muchos sitios lo bloquean por carga de servidor tanto como por derechos.

meta-externalagent Meta Entrenamiento

Recoge páginas para los modelos de Meta y para Meta AI.

Meta utiliza varios agentes. Este es el rastreador documentado que se usa para el entrenamiento.

Applebot-Extended Apple Entrenamiento

Token que controla el uso de tu contenido para Apple Intelligence.

No afecta a Applebot, que alimenta Siri y Spotlight: tu presencia en la búsqueda de Apple no se ve alterada.

Una por línea. Útil para un área de clientes, un carrito o una zona de pruebas.
Se añade al final del archivo. Déjalo vacío para omitirla.
Gratuito, ilimitado, sin cuenta

Esta herramienta funciona íntegramente en tu navegador. Nada de lo que escribes aquí llega a nuestros servidores, no se guarda nada, y no hay ni cuenta que crear ni cuota que respetar. Por eso podemos regalarla: no nos cuesta nada mantenerla.

Qué hace esta herramienta

Un robots.txt mal calibrado es la forma más rápida de desaparecer de las respuestas de IA sin darte cuenta. La confusión más frecuente y más cara afecta a OpenAI: GPTBot y OAI-SearchBot no hacen el mismo trabajo, y bloquear uno por el otro tiene consecuencias opuestas. Esta herramienta muestra la función real de cada robot antes de dejarte decidir.

  • Once robots de IA cubiertos, cada uno con su función real: entrenamiento, búsqueda y cita, visita provocada por un usuario, publicidad.
  • Cuatro preajustes, entre ellos uno que conserva las citas y rechaza a la vez la recogida para entrenamiento.
  • Añade rutas prohibidas que se aplican a los robots que dejas pasar, para proteger un área de clientes o un carrito.
  • Línea Sitemap añadida al final del archivo, y comentarios que recuerdan la función de cada robot.
  • Generación local: el archivo se fabrica en tu navegador, no se transmite nada.

Preguntas frecuentes

¿Bloquear GPTBot me hace desaparecer de ChatGPT?
No. GPTBot sirve para el entrenamiento de los modelos. Lo que condiciona tu presencia en las respuestas de ChatGPT es OAI-SearchBot, más ChatGPT-User para las recuperaciones en directo. Puedes rechazar perfectamente el entrenamiento y seguir siendo citable.
¿Los robots respetan de verdad el robots.txt?
Los agentes documentados de OpenAI, Anthropic, Google, Apple y Perplexity anuncian que lo respetan, y en la práctica lo hacen. robots.txt sigue siendo una convención, no una barrera técnica. Si de verdad necesitas impedir un acceso, hace falta un bloqueo en el cortafuegos de aplicación o en el CDN, con verificación de los rangos de direcciones IP publicados.
¿Dónde se coloca este archivo?
En la raíz del dominio, y solo ahí: https://ejemplo.com/robots.txt. Un archivo colocado en un subdirectorio no se lee nunca. Cada subdominio tiene su propio robots.txt.
¿Puedo bloquear solo una parte del sitio?
Sí. El campo de rutas prohibidas añade líneas Disallow a cada robot que dejas autorizado: conservan el acceso al sitio pero no a esos directorios. Es el enfoque correcto para un área de clientes o un embudo de compra.
¿Cómo compruebo que mis reglas se aplican?
Mira tus logs de servidor: son ellos los que dicen qué robots pasan realmente y por dónde. Es exactamente el trabajo de nuestro analizador de logs de crawlers de IA, que detecta además los bloqueos involuntarios del cortafuegos o del CDN.

Ir más allá del generador

Estas microherramientas producen un archivo. Los escáneres de Ready2GEO van a buscar lo que ocurre de verdad en tu sitio y dentro de las respuestas de los motores de IA.

Todas las herramientas de Ready2GEO