摘要

核心观点:AI 爬虫访问权限不能一概而论。OpenAI 在文档中区分了 OAI-SearchBot、GPTBot 以及 ChatGPT-User 的不同用途。内容发布方可以允许 ChatGPT 搜索自动抓取内容,同时另行设置规则,禁止内容被用于模型训练。 

现存难题:宽泛的 robots.txt 规则、CDN(内容分发网络)或 WAF(Web 应用防火墙)配置、老旧插件设置,往往会把所有 AI 机器人视作同类。这就容易导致网站实际部署的访问规则,和发布方真实的内容管控策略出现意料之外的偏差。 

解决方案:按照爬虫的用途制定管控策略,设置清晰、可复核的规则,再核验完整链路:robots.txt、边缘层控制、HTTP 响应、页面渲染与访问日志。访问权限只是技术基础,不代表一定会获得引用、排名、流量或者商业收益。


大多数网站团队都知道/robots.txt这个文件,但很少有人能说清这套现行策略,对搜索爬虫、训练爬虫、以及代用户发起的访问分别意味着什么。如今,在技术 SEO、GEO、内容管理、隐私审核以及 AI 搜索策略层面,这种区分至关重要。

实际要思考的核心问题,不是 “我们要不要屏蔽 AI 爬虫?” 而是:我们允许哪些自动化访问、出于什么目的、针对哪些公开内容,以及如何核验已部署的管控规则和该决策保持一致?本文提供一套可落地、经得起核查的决策框架。

你真正要做出的发布方决策是什么?

修改规则之前,先要拆分三个经常被合并成一条笼统策略的目标: 发布方既可以希望页面能够被自动化搜索收录,又不希望内容被用来优化生成式 AI 基础大模型;同时,针对 AI 产品用户直接发起的访问请求,还需要单独考量。

OpenAI 说明:OAI-SearchBot 用于在 ChatGPT 搜索功能中展示网站内容;GPTBot 抓取的内容则有可能用于训练其生成式基础大模型。官方同时明确,二者的配置相互独立:站点所有者可以放行 OAI-SearchBot,同时禁止 GPTBot 抓取。

这就把一个非黑即白的选择题,变成了策略设计工作。最终方案取决于你发布的公开内容类型、合同义务、产品入口、资源限制、隐私要求以及商业目标。该事项应当作为业务决策留存文档,不能直接沿用多年前默认的笼统配置。


决策板块实操问题策略示例结果需要留存的佐证材料
AI 搜索收录公开页面是否允许自动化搜索爬虫抓取?在指定公开路径放行对应的搜索爬虫策略审批人、robots.txt 版本、访问测试记录
AI 模型训练公开内容是否可用于基础大模型训练?若组织政策不允许,则禁止对应的训练爬虫策略说明、必要时的法务审核文件、复核日期
用户发起拉取当用户指令 AI 产品访问页面时,站点该如何响应?真正受限的信息采用应用层权限管控身份验证机制、响应逻辑、安全评审记录

OAI-SearchBot、GPTBot、ChatGPT-User 的区别

不能对这三类 UA(用户代理)采用同一套预设规则。官方文档定义的用途各不相同,因此发布方需要分别决策。

用户代理文档标注用途robots.txt 管控效力发布方建议
OAI-SearchBotOpenAI 称,用于 ChatGPT 搜索功能展示网站OpenAI 文档中,OAI-SearchBot 是用于搜索收录、搜索退订的管控对象决定是否允许合规公开内容被该搜索爬虫抓取
GPTBotOpenAI 称,抓取内容用于优化生成式基础大模型的实用性与安全性禁止 GPTBot,即表达不希望内容被用于模型训练的意愿将训练用途管控和 AI 搜索收录分开处理
ChatGPT-UserOpenAI 称,用于用户在 ChatGPT、自定义 GPT 中触发部分操作时访问页面OpenAI 提示:由于是用户主动发起,robots.txt 规则可能不生效不能依靠爬虫指令来保护涉密、合规受限内容

OAI-SearchBot:服务 ChatGPT 功能的搜索收录爬虫

如果涉及 ChatGPT 搜索功能的自动抓取权限,对应的爬虫就是 OAI-SearchBot。 OpenAI 建议:希望内容出现在这类搜索结果中的网站,需要在 robots.txt 放行 OAI-SearchBot,并放行官方公布的 IP 段。同时 robots.txt 的修改,大约需要 24 小时才能在 OpenAI 系统内生效。

需要精准理解这份文档的含义:放行爬虫只是打通抓取通道,不能保证页面一定会出现在 AI 回答里、获得引用、获得搜索排名或是带来流量。内容质量、相关性、可访问性、时效性、权威性、查询理解以及产品机制,都会影响最终展示效果。

GPTBot:生成式基础大模型的训练管控

GPTBot 对应的是另一项诉求:该爬虫抓取的内容,是否允许用于 OpenAI 基础大模型训练。 发布方可以选择对公开内容禁止 GPTBot 抓取,同时放行 OAI-SearchBot 用于自动搜索收录。在直接套用通用 “屏蔽所有 AI 爬虫” 规则前,这是最关键的区分点。

如果企业拥有自研资料、付费数据库、带内容授权条款、受监管内容或是存在合同约束,这项决策需要法务、隐私、信息安全和业务相关负责人共同评审。本文仅提供实操信息,不构成法律建议。

ChatGPT-User:用户主动触发的页面拉取,属于特殊场景

OpenAI 并未将 ChatGPT-User 定义为用于搜索收录的自动爬虫。它会在用户执行操作后访问页面,官方明确 robots.txt 规则在该场景下可能无效。

这条实操结论具备普适性:当信息需要严格保护时,公开爬虫指令无法替代身份校验、权限控制、付费墙、签名 URL 以及其他应用层防护手段。

robots.txt 如何管控 AI 爬虫访问

机器人排除协议(Robots Exclusion Protocol)规定,在站点根目录/robots.txt放置文本文件,通过 User-agent 分组搭配 Allow/Disallow 等访问规则。 规则冲突时,协议会优先匹配路径更具体的条目;如果没有单独指定 UA 分组,爬虫会匹配通用通配组(若存在)。

核心规则:User-agent、Allow、Disallow

如果你的策略是:保留 ChatGPT 自动搜索收录,同时禁止 GPTBot 用于训练,最简基础配置示例:

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

该示例仅作最简演示,并非通用方案,没有考虑站点现有的通配规则、子域名、应用路径、CMS 机制、边缘层配置以及合同约束。 所有规则都必须基于站点实际需要管控的 URL 真实样式做测试。

你可以设置精细化的单路径策略,但会增加复核工作量。如果策略目标是 “公开营销和文档内容允许抓取,内部应用入口禁止访问”,更稳妥的思路通常是:把内部入口做好真正的权限防护,自动爬虫仅面向可公开访问的内容。

robots.txt 无法保障和实现的事项

robots.txt 本身不属于访问控制系统。RFC 9309 协议明确说明:该协议规则不具备访问授权效力。谷歌同样说明,robots 规则无法强制约束爬虫行为,不能用来保护敏感页面。

由此引出三点重要结论:

  1. 不要把敏感 URL 写在文件里,就默认内容已经受到保护;

  2. 不要认为放行规则就代表爬虫一定成功抓取到页面;

  3. 不要认为 Disallow 屏蔽规则就能彻底解决曝光、安全、版权或者恶意抓取问题。 非公开内容必须使用账号凭证和应用层防护。

公开 / 受限 / 私有内容的策略示例

内容类型核心管控手段robots.txt 的作用复核负责人
公开稿件、专题页、定价页、文档页清晰爬虫策略 + 可正常访问的公开页面向指定爬虫传递预期访问策略SEO 与内容运营
低价值工具链接、参数变体地址、站内搜索结果技术 SEO 优化 + 规范 Canonical 标准链接在合适场景下减少无效抓取SEO 与技术开发
需要登录的应用、客户数据、内部系统身份认证、权限校验、安全服务配置仅作为补充,绝不作为安全边界安全与技术开发
授权内容、监管内容、受合同限制资料正式管控流程与访问限制经评审后,作为多项信号之一法务、隐私、安全、内容负责人

修改规则前,搭建发布方决策框架

完善的 AI 爬虫管控策略,第一步是梳理内容清单,而不是整理爬虫名单。 梳理站点内公开板块,按业务与合规风险对内容分类,明确各类爬虫的用途,确定每项决策的负责人。后续出现新模型、新 UA、CDN 变更、新产品入口时,可以重复这套复核流程。

梳理内容分类与业务风险

为域名建立清单:公开稿件、产品营销页、帮助中心、技术文档、客户门户、应用路由、内部工具、敏感数据集。 针对每一类内容,记录:是否有意对外公开、是否适合 AI 搜索收录、是否单独设置训练管控、是否依赖登录鉴权。这项工作同时可以优化传统技术 SEO:能够识别带参数链接、重复页面、孤立资源、被拦截脚本,以及需要统一在站点地图和内链体系里规范的公开页面。

按用途制定策略,而非简单按 “AI 机器人” 分类

“AI 机器人” 并不是足够精细的治理分类。用于搜索检索的爬虫、用于 AI 训练的爬虫、用户触发的拉取行为,三者性质完全不同。 先用通俗文字写清楚预期策略,再转化为指定 UA 规则、边缘配置与监控指标。

记录责任人、复核周期与例外项

指定 robots.txt 文件负责人与定期复核节奏。爬虫策略变化很快,建议按季度做技术复核;CDN/WAF 迁移、CMS 改版、访问安全事件、服务商爬虫文档重大变更时,需要立刻复核。 例外项要显性写明,不要隐藏在通用通配屏蔽规则中。

核查范围不止 robots.txt:CDN、WAF、页面渲染、访问日志

正确的 robots.txt 文件是必要条件,但远远不够。 CDN、Web 应用防火墙、爬虫管理平台、源服务器、CMS 插件、鉴权层、依赖 JS 渲染的页面,都可能拦截或修改请求。要把访问管控视作端到端完整系统。

  1. 核查 CDN 与爬虫管理层检查 CDN 和 WAF 里宽泛的 AI、自动化、爬虫、风险评分、限流、机器人分类规则。确认不会出现 robots.txt 放行,但流量在边缘节点直接被拦截的情况。 反之,如果企业决定限制某类爬虫,要保证技术管控和书面策略保持一致。不能仅凭 UA 字符串判定爬虫真伪。分析日志或配置例外时,要对照服务商官方最新 IP 段清单和服务器真实访问记录交叉核验。OpenAI 对外公布了旗下爬虫的 IP 参考范围。

  2. 核验合法请求与响应状态码每次修改爬虫策略后,优先测试公网/robots.txt是否正常加载,确认协议、域名、子域名无误。 再测试典型公开页面能否正常返回成功状态,不存在重定向死循环、登录拦截、弹窗拦截,或是核心资源被链路拦截。 调取服务器或 CDN 日志,查看目标 UA、请求路径、状态码、响应耗时、边缘节点处置记录。核心目的不是统计爬虫访问量,而是发现 “预期策略” 和 “实际访问行为” 之间的偏差。

  3. 确认公开内容可被抓取、具备有效价值仅放开访问权限,不代表页面能被 AI 搜索或通用搜索引擎有效识别。 公开内容需要内链可达、无需登录、输出标准 HTML、规范 Canonical 链接、正文可见、配置结构化数据。结构化数据用于明确页面实体和关联关系,不能替代优质正文内容。

10 分钟 AI 爬虫访问快速核查清单

部署新爬虫策略或启动 GEO 项目时,可使用这套轻量化核查流程,优先校验策略落地是否符合预期,之后再评估曝光指标:

  1. 直接访问https://你的域名.com/robots.txt,记录状态码、文件内容、缓存情况;

  2. 查找文件内是否有 OAI-SearchBot、GPTBot 以及策略中其他爬虫的独立分组配置;

  3. 检查通配分组User-agent: *;如果没有单独指定 UA 分组,爬虫会默认匹配这条通用规则;

  4. 逐条比对规则和书面决策:训练用途、自动搜索收录、用户发起拉取分开评估;

  5. 复核 CDN、WAF、爬虫管理、防火墙、限流配置,排查冲突策略;

  6. 测试典型公开 URL,确认正常响应、主内容完整渲染、关键资源可访问;

  7. 查看访问日志,核验 UA、官方 IP 匹配情况、请求地址、响应码、拦截原因;

  8. 核查站点地图与内链,保证你希望被抓取、被理解的公开内容可发现;

  9. 记录策略负责人、变更时间、例外项、下次复核日期;

  10. 单独衡量后续曝光效果。