面向 AI 爬虫的 robots.txt 生成器
在清楚每个 AI 爬虫到底做什么的前提下决定放行还是拦截,然后把生成的规则块复制进您的 robots.txt。
GPTBot 采集页面用于训练 OpenAI 的模型,拦截它对您在 ChatGPT 里的出现没有任何影响。OAI-SearchBot 则为 ChatGPT 的搜索索引供料:您的页面能否被检索、被概括、被带着链接引用,由它决定。拦截它,您就从 ChatGPT 的回答里消失了。很多网站照抄了一段拦截 GPTBot 的规则,又“保险起见”把 OAI-SearchBot 一起加上,等于亲手切断了自己正想争取的那条流量渠道。请逐行决定,不要一刀切。
采集页面,用于训练 OpenAI 的模型。
拦截它不会让您从 ChatGPT 的回答里消失。这是一个关于您数据的决定,不是关于您可见度的决定。
为 ChatGPT 的搜索索引页面。
正是这个爬虫决定您能否出现在 ChatGPT 的回答里、能否拿到链接。拦截它等于把自己从引用中删掉。
检查 ChatGPT Ads 所用的落地页。
如果您打算在 ChatGPT 里投放广告,它必不可少:没有它,您的落地页无法通过校验。
因为用户分享了链接、或就这个页面提了问,实时去把页面抓回来。
由真人实时触发的访问。拦截它,等于拒绝一次别人明确要求的访问。
为 Claude 模型采集页面。
Anthropic 还有负责实时抓取的 Claude-User 和负责搜索的 Claude-SearchBot:它们是彼此独立的代理,要分开决定。
为 Perplexity 那些带来源的回答索引页面。
Perplexity 每次都会展示来源。拦截它,就是放弃这些引用以及跟着来的流量。
一个开关标记,控制您的内容是否用于 Gemini 和回答依据。
它不是爬虫:既不改变您的收录,也不改变您在 Google Search 里的排名。
构建一个被大量训练反复取用的公开语料库。
对可见度没有任何直接好处:Common Crawl 不引用任何人。如果您要护住自己的内容,它是第一个该拦的。
为字节跳动的模型采集页面。
以抓取频率激进著称。很多网站拦它,出于服务器负载的考虑不亚于出于版权。
为 Meta 的模型和 Meta AI 采集页面。
Meta 有好几个代理,这一个是官方文档中用于训练的爬虫。
一个开关标记,控制您的内容是否用于 Apple Intelligence。
它不影响 Applebot,后者为 Siri 和 Spotlight 供料:您在 Apple 搜索里的存在不受波及。
把这段规则加进域名根目录下已有的 robots.txt。不要覆盖您现在的规则:robots.txt 是按 User-agent 分组读取的,您原有的那些对其他爬虫依然有效。
这个工具完全在您的浏览器里运行。您在这里输入的内容不会发送到我们的服务器,不会被保存,既不用注册账号,也没有配额限制。我们之所以能免费提供,是因为它对我们来说几乎没有运行成本。
这个工具能做什么
一份没调好的 robots.txt,是从 AI 回答里悄无声息消失的最快方式。最常见也最昂贵的混淆出在 OpenAI 身上:GPTBot 和 OAI-SearchBot 做的不是同一件事,把两者搞反,后果正好相反。这个工具先摆出每个爬虫的真实职责,再让您来拍板。
- 覆盖十一个 AI 爬虫,逐一说明其真实职责:模型训练、搜索与引用、用户触发的抓取、广告。
- 四套预设,其中一套在拒绝训练采集的同时保住引用。
- 可以给放行的爬虫补上禁止路径,用来护住客户中心或购物车。
- 在文件末尾追加 Sitemap 行,并用注释标明每个爬虫的职责。
- 本地生成:文件在您的浏览器里产出,不向外传输任何数据。
常见问题
拦截 GPTBot 会让我从 ChatGPT 消失吗?
爬虫真的会遵守 robots.txt 吗?
这个文件放在哪里?
可以只拦网站的一部分吗?
怎么确认我的规则真的生效了?
不止于生成文件
这些微工具只负责产出一个文件。Ready2GEO 的扫描器则会去查看您的网站上、以及 AI 回答里究竟发生了什么。
检测您的网站是否真的符合 ChatGPT 广告平台的接入条件、能否被它正常使用:爬虫访问权限、页面结构、商业信号。
检测我的网站 🕷️ AI 爬虫日志分析器粘贴服务器日志,看清哪些 AI 爬虫真的来过、来的频率有多高、又在哪些页面上碰了壁。
分析我的日志 🧭 GEO 全面审计打包审计把所有扫描器汇总成一份报告,附带按优先级排序的修复清单和 PDF 导出。
开始审计