Инструменты / Генератор robots.txt для ИИ
🚦 Бесплатно и без ограничений

Генератор robots.txt для ИИ-роботов

Разрешайте или блокируйте каждого ИИ-робота осознанно, затем скопируйте блок для добавления в robots.txt.

GPTBot и OAI-SearchBot: два разных решения, а не одно

GPTBot собирает страницы для обучения моделей OpenAI. Его блокировка никак не влияет на присутствие вашего сайта в ChatGPT. OAI-SearchBot, напротив, наполняет поисковый индекс ChatGPT: именно он решает, может ли ваша страница быть получена, кратко пересказана и процитирована со ссылкой. Заблокировав его, вы исчезаете из ответов ChatGPT. Многие сайты скопировали блокировку GPTBot и добавили к ней OAI-SearchBot «на всякий случай», тем самым сами отрезав себе канал трафика, за который боролись. Принимайте решение по каждой строке отдельно, а не одним блоком.

Пресеты
Открывает доступ всем, кто может вас процитировать, закрывает сборщиков, которые никогда не цитируют.
GPTBot OpenAI Обучение

Собирает страницы для обучения моделей OpenAI.

Блокировка не убирает вас из ответов ChatGPT. Это решение касается ваших данных, а не вашей видимости.

OAI-SearchBot OpenAI Поиск и цитирование

Индексирует страницы для поиска ChatGPT.

Именно этот робот определяет ваше присутствие и наличие ссылки в ответах ChatGPT. Блокировка лишает вас цитирований.

OAI-AdsBot OpenAI Реклама

Проверяет посадочные страницы объявлений ChatGPT Ads.

Необходим, если вы планируете покупать рекламу в ChatGPT: без него ваши посадочные страницы не смогут пройти проверку.

ChatGPT-User OpenAI Переход по запросу пользователя

Загружает страницу в реальном времени, потому что пользователь поделился ссылкой или задал по ней вопрос.

Трафик создаётся реальным человеком в реальном времени. Блокировка равносильна отказу в явно запрошенном посещении.

ClaudeBot Anthropic Обучение

Собирает страницы для моделей Claude.

Anthropic также использует Claude-User для загрузки страниц в реальном времени и Claude-SearchBot для поиска: это отдельные агенты, их нужно настраивать по отдельности.

PerplexityBot Perplexity Поиск и цитирование

Индексирует страницы для ответов Perplexity со ссылками на источники.

Perplexity всегда показывает источники. Заблокировав его, вы отказываетесь от этих цитирований и от сопутствующего трафика.

Google-Extended Google Обучение

Токен, управляющий использованием вашего контента для Gemini и формирования ответов на его основе.

Это не поисковый робот: он не влияет ни на индексацию, ни на позиции в Google Search.

CCBot Common Crawl Обучение

Формирует открытый корпус данных, который используется во многих обучающих наборах.

Никакой прямой пользы для видимости: Common Crawl никого не цитирует. Это первый кандидат на блокировку, если вы защищаете свои данные.

Bytespider ByteDance Обучение

Собирает страницы для моделей ByteDance.

Известен агрессивной частотой обхода. Многие сайты блокируют его как из-за нагрузки на сервер, так и по соображениям прав на контент.

meta-externalagent Meta Обучение

Собирает страницы для моделей Meta и Meta AI.

Meta использует несколько агентов. Именно этот агент официально задокументирован как используемый для обучения моделей.

Applebot-Extended Apple Обучение

Токен, управляющий использованием вашего контента для Apple Intelligence.

Не затрагивает Applebot, который питает данными Siri и Spotlight: ваше присутствие в поиске Apple при этом не меняется.

По одному на строку. Полезно для личного кабинета, корзины или тестовой зоны.
Добавляется в конец файла. Оставьте пустым, чтобы пропустить.
Бесплатно, без ограничений, без регистрации

Этот инструмент полностью работает в вашем браузере. Введённые здесь данные не попадают на наши серверы, ничего не сохраняется, не нужно создавать аккаунт и соблюдать какие-либо лимиты. Поэтому мы можем предложить его бесплатно: он ничего нам не стоит.

Что делает этот инструмент

Неправильно настроенный robots.txt быстрее всего приводит к тому, что вы незаметно исчезаете из ответов ИИ-систем. Самая частая и самая дорогая путаница касается OpenAI: GPTBot и OAI-SearchBot выполняют разные задачи, и блокировка одного вместо другого даёт противоположный эффект. Этот инструмент показывает реальную роль каждого робота, прежде чем вы примете решение.

  • Одиннадцать ИИ-роботов, у каждого указана его реальная роль: обучение моделей, поиск и цитирование, переход по запросу пользователя, реклама.
  • Четыре готовых пресета, включая один, который сохраняет цитирование, но запрещает сбор данных для обучения.
  • Добавление запрещённых путей, которые применяются к разрешённым роботам, чтобы защитить личный кабинет или корзину.
  • Строка Sitemap добавляется в конец файла, плюс комментарии с напоминанием о роли каждого робота.
  • Локальная генерация: файл создаётся в вашем браузере, ничего не передаётся на сервер.

Частые вопросы

Если заблокировать GPTBot, исчезну ли я из ChatGPT?
Нет. GPTBot служит для обучения моделей. Ваше присутствие в ответах ChatGPT определяют OAI-SearchBot и ChatGPT-User для загрузки страниц в реальном времени. Вы можете полностью отказаться от участия в обучении моделей и при этом остаться доступным для цитирования.
Действительно ли роботы соблюдают robots.txt?
Задокументированные агенты OpenAI, Anthropic, Google, Apple и Perplexity заявляют, что соблюдают его, и на практике так и происходит. robots.txt остаётся договорённостью, а не техническим барьером. Если доступ нужно перекрыть по-настоящему, потребуется блокировка на уровне файрвола приложения или CDN с проверкой опубликованных диапазонов IP-адресов.
Куда поместить этот файл?
Только в корень домена: https://example.com/robots.txt. Файл, размещённый в подкаталоге, никогда не читается. У каждого поддомена свой собственный robots.txt.
Можно ли заблокировать только часть сайта?
Да. Поле запрещённых путей добавляет строки Disallow для каждого разрешённого робота: доступ к сайту у них сохраняется, а к этим разделам нет. Это правильный подход для личного кабинета или процесса оформления заказа.
Как проверить, что мои правила применяются?
Посмотрите логи сервера: именно они показывают, какие роботы реально заходят и на какие страницы. Именно для этого нужен наш анализатор логов ИИ-краулеров, который также выявляет непреднамеренные блокировки со стороны файрвола или CDN.

Что дальше, помимо генератора

Эти микро-инструменты создают файл. Сканеры Ready2GEO идут дальше: они проверяют, что реально происходит на вашем сайте и в ответах ИИ-систем.

Все инструменты Ready2GEO