摘要
核心观点:AI 爬虫访问权限不能一概而论。OpenAI 在文档中区分了 OAI-SearchBot、GPTBot 以及 ChatGPT-User 的不同用途。内容发布方可以允许 ChatGPT 搜索自动抓取内容,同时另行设置规则,禁止内容被用于模型训练。
现存难题:宽泛的 robots.txt 规则、CDN(内容分发网络)或 WAF(Web 应用防火墙)配置、老旧插件设置,往往会把所有 AI 机器人视作同类。这就容易导致网站实际部署的访问规则,和发布方真实的内容管控策略出现意料之外的偏差。
解决方案:按照爬虫的用途制定管控策略,设置清晰、可复核的规则,再核验完整链路:robots.txt、边缘层控制、HTTP 响应、页面渲染与访问日志。访问权限只是技术基础,不代表一定会获得引用、排名、流量或者商业收益。
大多数网站团队都知道/robots.txt这个文件,但很少有人能说清这套现行策略,对搜索爬虫、训练爬虫、以及代用户发起的访问分别意味着什么。如今,在技术 SEO、GEO、内容管理、隐私审核以及 AI 搜索策略层面,这种区分至关重要。
实际要思考的核心问题,不是 “我们要不要屏蔽 AI 爬虫?” 而是:我们允许哪些自动化访问、出于什么目的、针对哪些公开内容,以及如何核验已部署的管控规则和该决策保持一致?本文提供一套可落地、经得起核查的决策框架。
你真正要做出的发布方决策是什么?
修改规则之前,先要拆分三个经常被合并成一条笼统策略的目标: 发布方既可以希望页面能够被自动化搜索收录,又不希望内容被用来优化生成式 AI 基础大模型;同时,针对 AI 产品用户直接发起的访问请求,还需要单独考量。
OpenAI 说明:OAI-SearchBot 用于在 ChatGPT 搜索功能中展示网站内容;GPTBot 抓取的内容则有可能用于训练其生成式基础大模型。官方同时明确,二者的配置相互独立:站点所有者可以放行 OAI-SearchBot,同时禁止 GPTBot 抓取。
这就把一个非黑即白的选择题,变成了策略设计工作。最终方案取决于你发布的公开内容类型、合同义务、产品入口、资源限制、隐私要求以及商业目标。该事项应当作为业务决策留存文档,不能直接沿用多年前默认的笼统配置。
| 决策板块 | 实操问题 | 策略示例结果 | 需要留存的佐证材料 |
|---|---|---|---|
| AI 搜索收录 | 公开页面是否允许自动化搜索爬虫抓取? | 在指定公开路径放行对应的搜索爬虫 | 策略审批人、robots.txt 版本、访问测试记录 |
| AI 模型训练 | 公开内容是否可用于基础大模型训练? | 若组织政策不允许,则禁止对应的训练爬虫 | 策略说明、必要时的法务审核文件、复核日期 |
| 用户发起拉取 | 当用户指令 AI 产品访问页面时,站点该如何响应? | 真正受限的信息采用应用层权限管控 | 身份验证机制、响应逻辑、安全评审记录 |
OAI-SearchBot、GPTBot、ChatGPT-User 的区别
不能对这三类 UA(用户代理)采用同一套预设规则。官方文档定义的用途各不相同,因此发布方需要分别决策。
| 用户代理 | 文档标注用途 | robots.txt 管控效力 | 发布方建议 |
|---|---|---|---|
| OAI-SearchBot | OpenAI 称,用于 ChatGPT 搜索功能展示网站 | OpenAI 文档中,OAI-SearchBot 是用于搜索收录、搜索退订的管控对象 | 决定是否允许合规公开内容被该搜索爬虫抓取 |
| GPTBot | OpenAI 称,抓取内容用于优化生成式基础大模型的实用性与安全性 | 禁止 GPTBot,即表达不希望内容被用于模型训练的意愿 | 将训练用途管控和 AI 搜索收录分开处理 |
| ChatGPT-User | OpenAI 称,用于用户在 ChatGPT、自定义 GPT 中触发部分操作时访问页面 | OpenAI 提示:由于是用户主动发起,robots.txt 规则可能不生效 | 不能依靠爬虫指令来保护涉密、合规受限内容 |
OAI-SearchBot:服务 ChatGPT 功能的搜索收录爬虫
如果涉及 ChatGPT 搜索功能的自动抓取权限,对应的爬虫就是 OAI-SearchBot。 OpenAI 建议:希望内容出现在这类搜索结果中的网站,需要在 robots.txt 放行 OAI-SearchBot,并放行官方公布的 IP 段。同时 robots.txt 的修改,大约需要 24 小时才能在 OpenAI 系统内生效。
需要精准理解这份文档的含义:放行爬虫只是打通抓取通道,不能保证页面一定会出现在 AI 回答里、获得引用、获得搜索排名或是带来流量。内容质量、相关性、可访问性、时效性、权威性、查询理解以及产品机制,都会影响最终展示效果。
GPTBot:生成式基础大模型的训练管控
GPTBot 对应的是另一项诉求:该爬虫抓取的内容,是否允许用于 OpenAI 基础大模型训练。 发布方可以选择对公开内容禁止 GPTBot 抓取,同时放行 OAI-SearchBot 用于自动搜索收录。在直接套用通用 “屏蔽所有 AI 爬虫” 规则前,这是最关键的区分点。
如果企业拥有自研资料、付费数据库、带内容授权条款、受监管内容或是存在合同约束,这项决策需要法务、隐私、信息安全和业务相关负责人共同评审。本文仅提供实操信息,不构成法律建议。
ChatGPT-User:用户主动触发的页面拉取,属于特殊场景
OpenAI 并未将 ChatGPT-User 定义为用于搜索收录的自动爬虫。它会在用户执行操作后访问页面,官方明确 robots.txt 规则在该场景下可能无效。
这条实操结论具备普适性:当信息需要严格保护时,公开爬虫指令无法替代身份校验、权限控制、付费墙、签名 URL 以及其他应用层防护手段。
robots.txt 如何管控 AI 爬虫访问
机器人排除协议(Robots Exclusion Protocol)规定,在站点根目录/robots.txt放置文本文件,通过 User-agent 分组搭配 Allow/Disallow 等访问规则。
规则冲突时,协议会优先匹配路径更具体的条目;如果没有单独指定 UA 分组,爬虫会匹配通用通配组(若存在)。
核心规则:User-agent、Allow、Disallow
如果你的策略是:保留 ChatGPT 自动搜索收录,同时禁止 GPTBot 用于训练,最简基础配置示例:
User-agent: OAI-SearchBot Allow: / User-agent: GPTBot Disallow: /
该示例仅作最简演示,并非通用方案,没有考虑站点现有的通配规则、子域名、应用路径、CMS 机制、边缘层配置以及合同约束。 所有规则都必须基于站点实际需要管控的 URL 真实样式做测试。
你可以设置精细化的单路径策略,但会增加复核工作量。如果策略目标是 “公开营销和文档内容允许抓取,内部应用入口禁止访问”,更稳妥的思路通常是:把内部入口做好真正的权限防护,自动爬虫仅面向可公开访问的内容。
robots.txt 无法保障和实现的事项
robots.txt 本身不属于访问控制系统。RFC 9309 协议明确说明:该协议规则不具备访问授权效力。谷歌同样说明,robots 规则无法强制约束爬虫行为,不能用来保护敏感页面。
由此引出三点重要结论:
不要把敏感 URL 写在文件里,就默认内容已经受到保护;
不要认为放行规则就代表爬虫一定成功抓取到页面;
不要认为 Disallow 屏蔽规则就能彻底解决曝光、安全、版权或者恶意抓取问题。 非公开内容必须使用账号凭证和应用层防护。
公开 / 受限 / 私有内容的策略示例
| 内容类型 | 核心管控手段 | robots.txt 的作用 | 复核负责人 |
|---|---|---|---|
| 公开稿件、专题页、定价页、文档页 | 清晰爬虫策略 + 可正常访问的公开页面 | 向指定爬虫传递预期访问策略 | SEO 与内容运营 |
| 低价值工具链接、参数变体地址、站内搜索结果 | 技术 SEO 优化 + 规范 Canonical 标准链接 | 在合适场景下减少无效抓取 | SEO 与技术开发 |
| 需要登录的应用、客户数据、内部系统 | 身份认证、权限校验、安全服务配置 | 仅作为补充,绝不作为安全边界 | 安全与技术开发 |
| 授权内容、监管内容、受合同限制资料 | 正式管控流程与访问限制 | 经评审后,作为多项信号之一 | 法务、隐私、安全、内容负责人 |
修改规则前,搭建发布方决策框架
完善的 AI 爬虫管控策略,第一步是梳理内容清单,而不是整理爬虫名单。 梳理站点内公开板块,按业务与合规风险对内容分类,明确各类爬虫的用途,确定每项决策的负责人。后续出现新模型、新 UA、CDN 变更、新产品入口时,可以重复这套复核流程。
梳理内容分类与业务风险
为域名建立清单:公开稿件、产品营销页、帮助中心、技术文档、客户门户、应用路由、内部工具、敏感数据集。 针对每一类内容,记录:是否有意对外公开、是否适合 AI 搜索收录、是否单独设置训练管控、是否依赖登录鉴权。这项工作同时可以优化传统技术 SEO:能够识别带参数链接、重复页面、孤立资源、被拦截脚本,以及需要统一在站点地图和内链体系里规范的公开页面。
按用途制定策略,而非简单按 “AI 机器人” 分类
“AI 机器人” 并不是足够精细的治理分类。用于搜索检索的爬虫、用于 AI 训练的爬虫、用户触发的拉取行为,三者性质完全不同。 先用通俗文字写清楚预期策略,再转化为指定 UA 规则、边缘配置与监控指标。
记录责任人、复核周期与例外项
指定 robots.txt 文件负责人与定期复核节奏。爬虫策略变化很快,建议按季度做技术复核;CDN/WAF 迁移、CMS 改版、访问安全事件、服务商爬虫文档重大变更时,需要立刻复核。 例外项要显性写明,不要隐藏在通用通配屏蔽规则中。
核查范围不止 robots.txt:CDN、WAF、页面渲染、访问日志
正确的 robots.txt 文件是必要条件,但远远不够。 CDN、Web 应用防火墙、爬虫管理平台、源服务器、CMS 插件、鉴权层、依赖 JS 渲染的页面,都可能拦截或修改请求。要把访问管控视作端到端完整系统。
核查 CDN 与爬虫管理层检查 CDN 和 WAF 里宽泛的 AI、自动化、爬虫、风险评分、限流、机器人分类规则。确认不会出现 robots.txt 放行,但流量在边缘节点直接被拦截的情况。 反之,如果企业决定限制某类爬虫,要保证技术管控和书面策略保持一致。不能仅凭 UA 字符串判定爬虫真伪。分析日志或配置例外时,要对照服务商官方最新 IP 段清单和服务器真实访问记录交叉核验。OpenAI 对外公布了旗下爬虫的 IP 参考范围。
核验合法请求与响应状态码每次修改爬虫策略后,优先测试公网
/robots.txt是否正常加载,确认协议、域名、子域名无误。 再测试典型公开页面能否正常返回成功状态,不存在重定向死循环、登录拦截、弹窗拦截,或是核心资源被链路拦截。 调取服务器或 CDN 日志,查看目标 UA、请求路径、状态码、响应耗时、边缘节点处置记录。核心目的不是统计爬虫访问量,而是发现 “预期策略” 和 “实际访问行为” 之间的偏差。确认公开内容可被抓取、具备有效价值仅放开访问权限,不代表页面能被 AI 搜索或通用搜索引擎有效识别。 公开内容需要内链可达、无需登录、输出标准 HTML、规范 Canonical 链接、正文可见、配置结构化数据。结构化数据用于明确页面实体和关联关系,不能替代优质正文内容。
10 分钟 AI 爬虫访问快速核查清单
部署新爬虫策略或启动 GEO 项目时,可使用这套轻量化核查流程,优先校验策略落地是否符合预期,之后再评估曝光指标:
直接访问
https://你的域名.com/robots.txt,记录状态码、文件内容、缓存情况;查找文件内是否有 OAI-SearchBot、GPTBot 以及策略中其他爬虫的独立分组配置;
检查通配分组
User-agent: *;如果没有单独指定 UA 分组,爬虫会默认匹配这条通用规则;逐条比对规则和书面决策:训练用途、自动搜索收录、用户发起拉取分开评估;
复核 CDN、WAF、爬虫管理、防火墙、限流配置,排查冲突策略;
测试典型公开 URL,确认正常响应、主内容完整渲染、关键资源可访问;
查看访问日志,核验 UA、官方 IP 匹配情况、请求地址、响应码、拦截原因;
核查站点地图与内链,保证你希望被抓取、被理解的公开内容可发现;
记录策略负责人、变更时间、例外项、下次复核日期;
单独衡量后续曝光效果。