工具 / AI robots.txt 生成器
🚦 免费且无限制

面向 AI 爬虫的 robots.txt 生成器

在清楚每个 AI 爬虫到底做什么的前提下决定放行还是拦截,然后把生成的规则块复制进您的 robots.txt。

GPTBot 与 OAI-SearchBot:这是两个决定,不是一个

GPTBot 采集页面用于训练 OpenAI 的模型,拦截它对您在 ChatGPT 里的出现没有任何影响。OAI-SearchBot 则为 ChatGPT 的搜索索引供料:您的页面能否被检索、被概括、被带着链接引用,由它决定。拦截它,您就从 ChatGPT 的回答里消失了。很多网站照抄了一段拦截 GPTBot 的规则,又“保险起见”把 OAI-SearchBot 一起加上,等于亲手切断了自己正想争取的那条流量渠道。请逐行决定,不要一刀切。

预设
放行所有可能引用您的爬虫,关掉那些从不引用的采集器。
GPTBot OpenAI 模型训练

采集页面,用于训练 OpenAI 的模型。

拦截它不会让您从 ChatGPT 的回答里消失。这是一个关于您数据的决定,不是关于您可见度的决定。

OAI-SearchBot OpenAI 搜索与引用

为 ChatGPT 的搜索索引页面。

正是这个爬虫决定您能否出现在 ChatGPT 的回答里、能否拿到链接。拦截它等于把自己从引用中删掉。

OAI-AdsBot OpenAI 广告

检查 ChatGPT Ads 所用的落地页。

如果您打算在 ChatGPT 里投放广告,它必不可少:没有它,您的落地页无法通过校验。

ChatGPT-User OpenAI 用户触发的抓取

因为用户分享了链接、或就这个页面提了问,实时去把页面抓回来。

由真人实时触发的访问。拦截它,等于拒绝一次别人明确要求的访问。

ClaudeBot Anthropic 模型训练

为 Claude 模型采集页面。

Anthropic 还有负责实时抓取的 Claude-User 和负责搜索的 Claude-SearchBot:它们是彼此独立的代理,要分开决定。

PerplexityBot Perplexity 搜索与引用

为 Perplexity 那些带来源的回答索引页面。

Perplexity 每次都会展示来源。拦截它,就是放弃这些引用以及跟着来的流量。

Google-Extended Google 模型训练

一个开关标记,控制您的内容是否用于 Gemini 和回答依据。

它不是爬虫:既不改变您的收录,也不改变您在 Google Search 里的排名。

CCBot Common Crawl 模型训练

构建一个被大量训练反复取用的公开语料库。

对可见度没有任何直接好处:Common Crawl 不引用任何人。如果您要护住自己的内容,它是第一个该拦的。

Bytespider ByteDance 模型训练

为字节跳动的模型采集页面。

以抓取频率激进著称。很多网站拦它,出于服务器负载的考虑不亚于出于版权。

meta-externalagent Meta 模型训练

为 Meta 的模型和 Meta AI 采集页面。

Meta 有好几个代理,这一个是官方文档中用于训练的爬虫。

Applebot-Extended Apple 模型训练

一个开关标记,控制您的内容是否用于 Apple Intelligence。

它不影响 Applebot,后者为 Siri 和 Spotlight 供料:您在 Apple 搜索里的存在不受波及。

每行一个。适合客户中心、购物车或测试环境。
会追加在文件末尾。留空则不写入。
免费、不限次数、无需注册

这个工具完全在您的浏览器里运行。您在这里输入的内容不会发送到我们的服务器,不会被保存,既不用注册账号,也没有配额限制。我们之所以能免费提供,是因为它对我们来说几乎没有运行成本。

这个工具能做什么

一份没调好的 robots.txt,是从 AI 回答里悄无声息消失的最快方式。最常见也最昂贵的混淆出在 OpenAI 身上:GPTBot 和 OAI-SearchBot 做的不是同一件事,把两者搞反,后果正好相反。这个工具先摆出每个爬虫的真实职责,再让您来拍板。

  • 覆盖十一个 AI 爬虫,逐一说明其真实职责:模型训练、搜索与引用、用户触发的抓取、广告。
  • 四套预设,其中一套在拒绝训练采集的同时保住引用。
  • 可以给放行的爬虫补上禁止路径,用来护住客户中心或购物车。
  • 在文件末尾追加 Sitemap 行,并用注释标明每个爬虫的职责。
  • 本地生成:文件在您的浏览器里产出,不向外传输任何数据。

常见问题

拦截 GPTBot 会让我从 ChatGPT 消失吗?
不会。GPTBot 是用于模型训练的。决定您能否出现在 ChatGPT 回答里的是 OAI-SearchBot,再加上负责实时抓取的 ChatGPT-User。您完全可以既拒绝训练采集,又保持可被引用。
爬虫真的会遵守 robots.txt 吗?
OpenAI、Anthropic、Google、Apple 和 Perplexity 官方文档里的代理都声明遵守,实践中也确实如此。robots.txt 终究是一种约定,不是技术屏障。如果您真的需要阻止访问,就得在应用防火墙或 CDN 层面拦截,并对照官方公布的 IP 段做验证。
这个文件放在哪里?
域名根目录,而且只能放在那里:https://example.com/robots.txt。放在子目录里的文件永远不会被读取。每个子域名都有自己的 robots.txt。
可以只拦网站的一部分吗?
可以。禁止路径这个字段会给每个放行的爬虫加上 Disallow 行:它们仍然能访问网站,但进不了这些目录。对客户中心或下单流程来说,这才是正确做法。
怎么确认我的规则真的生效了?
去看服务器日志:只有它能告诉您哪些爬虫真的来过、又抓了什么。这正是我们那个 AI 爬虫日志分析器做的事,它还能揪出防火墙或 CDN 造成的误拦截。

不止于生成文件

这些微工具只负责产出一个文件。Ready2GEO 的扫描器则会去查看您的网站上、以及 AI 回答里究竟发生了什么。

Ready2GEO 全部工具