AI抓取器该放行还是屏蔽?搜索、用户触发与训练三类分流与六平台令牌对照

AI抓取器该放行还是屏蔽?搜索、用户触发与训练三类分流与六平台令牌对照

企业官网面对越来越多的AI抓取器,该放行谁、拦住谁、怎么拦才生效?本文依据Google、OpenAI、Anthropic、Perplexity、Apple、Common Crawl与百度当期官方文档(核验至2026-08-04),把抓取器按搜索型、用户触发型、训练型三类用途分流,给出六平台robots.txt令牌对照表、四条不可叠加红线(专属组不继承通配组、屏蔽抓取不等于控制展示、用户触发型robots拦不住、别用IP封禁替代)与四问决策法及上线核对清单。不承诺排名、收录或...

本文回答一个问题:企业官网面对越来越多的 AI 抓取器,到底该放行谁、拦住谁、怎么拦才真的生效。适用对象是已有官网在跑、需要同时兼顾搜索露出与内容资产控制的 B2B 企业(企业官网、外贸独立站),执行人通常是技术负责人加市场负责人。所有抓取器名称、令牌与规则均取自各平台当期官方文档,信息核验截至 2026-08-04

先给结论:"AI 抓取器"不是一个东西,而是三类用途完全不同的访问者——让你被 AI 搜索找到并引用的、用户主动点开时才来取一次的、以及把你的内容拿去训练模型的。把它们混成一条规则处理,结果通常是两头落空:想留的曝光被自己掐掉,想拦的训练照样拦不住。下面按"先分类、再对照、后排雷"的顺序给出可直接落地的决策表与红线清单。

本文只讲非搜索型与 AI 相关抓取器的身份识别与授权分流。传统搜索引擎的抓取与索引控制(robots.txt、noindex、状态码、站点地图这四层信号怎么配合)是另一件事,请先看网站抓取索引基础怎么搭?robots.txt、noindex、状态码与站点地图四层控制信号

一、先按用途分三类,别按厂商分

Google 官方把自己的客户端分成三类:常规抓取器(自动抓取时始终遵守 robots.txt)、特例抓取器(与站点存在约定,可能忽略全局 robots.txt 规则)、用户触发型取用器(由终端用户触发,因此一般不遵守 robots.txt)[F01]。这个三分法恰好可以推广到所有厂商,因为 OpenAI、Anthropic、Perplexity 现在都按同样思路拆分了自己的机器人。

把厂商维度换成用途维度,你要做的决策就只剩三个:

  • 搜索型(Search)——目的是让你的内容出现在 AI 搜索的回答与引用里。拦它 = 主动放弃这块曝光。
  • 用户触发型(Agent / User)——用户在对话里问到、或让 AI 打开你的页面时,实时来取一次。拦它 = 潜在客户当场看不到你的内容。
  • 训练型(Training)——抓取内容用于训练或微调模型。拦它 = 内容不进未来的模型权重,与当下曝光基本无关。

Cloudflare 也是按这三种行为(Search / Agent / Training)而不是按"是不是 AI"来给机器人分类的,理由相同:同一家厂商的不同机器人对你的商业价值完全相反,一个标签盖不住[F22]。

对绝大多数 B2B 企业官网,兆派给的默认姿势是:搜索型放行、用户触发型放行、训练型按内容资产价值单独决定。官网内容本来就是拿来被找到的,拦搜索型等于自断获客路径;而训练型是唯一一类"拦了不影响当下曝光"的,才是真正值得讨论的那格。

二、各家抓取器与 robots.txt 令牌对照表

AI抓取器三类用途与robots.txt令牌对照:搜索型、用户触发型、训练型

下表只收录各平台官方文档明确列出的令牌,均核验至 2026-08-04。令牌大小写不敏感,但拼写必须与官方一致,写错等于没写。

厂商用途robots.txt 令牌拦掉会失去什么(官方口径)
Google搜索(含 AI Overviews / AI Mode)GooglebotAI Overviews 与 AI Mode 属于 Google 搜索,抓取控制就是 Googlebot 的 robots.txt 指令,没有单独的 AI 抓取器可拦[F05]
训练与 groundingGoogle-Extended用于管理内容是否用于训练未来的 Gemini 模型、以及 Gemini Apps 与 Vertex AI 上 Grounding with Google Search 的落地;不影响站点在 Google 搜索中的收录,也不作为排名信号[F03]
通用 / 云端代理GoogleOther、GoogleOther-Image、GoogleOther-Video、Google-CloudVertexBotGoogleOther 不对应任何特定产品,是各产品团队抓取公开内容的通用爬虫;Google-CloudVertexBot 只影响站点所有者自己请求的 Vertex AI Agent 构建,对搜索无影响[F02]
OpenAI搜索OAI-SearchBot退出后不会出现在 ChatGPT 搜索回答中,但仍可能作为导航链接出现[F06]
用户触发ChatGPT-User用户提问时可能访问页面;因为是用户发起,robots.txt 规则可能不适用;它也不用于决定内容能否出现在 Search,Search 的退出请用 OAI-SearchBot[F08]
训练 / 广告校验GPTBot;OAI-AdsBotGPTBot 抓取的内容可能用于训练生成式基础模型,屏蔽即表示不希望被用于训练;OAI-AdsBot 只访问被提交为广告的落地页,其采集数据不用于训练基础模型[F07]
Anthropic搜索Claude-SearchBot禁用后系统不会为搜索优化收录你的内容,可能降低你在用户搜索结果中的可见度与准确度[F10]
用户触发Claude-User禁用后系统无法在用户提问时取回你的内容,可能降低你在用户主导的网页搜索中的可见度[F10]
训练ClaudeBot限制后表示该站未来的材料应被排除在模型训练数据集之外[F10]
Perplexity搜索PerplexityBot用于在 Perplexity 搜索结果中呈现并链接网站,不用于为 AI 基础模型抓取内容;想出现在结果中应允许它[F12]
用户触发Perplexity-User用户提问时可能访问页面并在回答中附链接;由于是用户发起的取用,一般忽略 robots.txt 规则[F13]
Apple搜索 + 训练(同一抓取)Applebot抓取数据支撑 Spotlight、Siri、Safari 的搜索能力,也可能用于训练 Apple 基础模型[F15]
仅退出训练Applebot-Extended发布者可用它退出"内容被用于训练生成式基础模型"[F15]
Common Crawl公开语料库CCBotUA 为 CCBot/2.0;robots.txt 屏蔽即可。官方提示存在冒充 CCBot 的爬虫,建议验证 UA 真伪[F19]
百度搜索(分产品)Baiduspider、Baiduspider-image、Baiduspider-video、Baiduspider-news 等Baiduspider 遵守 robots.txt 协议;屏蔽后页面不会出现在百度搜索及百度提供的其他搜索结果中[F20]

两个容易被忽略的时效数字。OpenAI 官方提示,站点 robots.txt 更新后,其系统调整搜索侧结果大约需要 24 小时[F09];Perplexity 同样写明设置变更最多需要 24 小时才能反映到系统[F12]。所以改完 robots.txt 当天就去看日志说"没用",是判断过早。Google 侧的口径则是 robots.txt 内容通常缓存最多 24 小时,超时或 5xx 时可能缓存更久[F17]。

三、四条不可叠加红线:为什么你的设置没生效

四条不可叠加红线:专属组不继承、屏蔽不等于控展示、用户触发型robots无效、别用IP封禁替代

这四条都是官方文档写死的机制,踩中任意一条,前面表格填得再对也白填。

  1. 红线一:写了专属组,就不再继承通配组。Google robots.txt 规范明确:对某个爬虫只有一个组有效,爬虫会选择与自身最匹配的最具体的那个组,其他组一律忽略;UA 专属组与全局组(*)不会合并[F16]。这条杀伤力最大——你原本在 User-agent: * 下屏蔽了后台入口和接口路径,为了拦训练又新加了一个 User-agent: GPTBot 组,结果 GPTBot 从此不再继承那些后台屏蔽规则。正确做法是:给某个 bot 单开组时,把它需要遵守的全部规则在该组内写全,不要指望继承。

  2. 红线二:屏蔽抓取 ≠ 控制展示,二者不能互相替代。Google 明确说明:noindexnosnippetdata-nosnippetmax-snippet 这些页面级与文本级设置,只有在爬虫被允许访问该页面时才能被读取和遵守[F04]。所以用 robots.txt 一刀切屏蔽后再去页面上写 nosnippet,那行标记根本没人读得到。想控制"露出多少",就必须放行抓取。

  3. 红线三:用户触发型取用器,robots.txt 拦不住。Google 的用户触发型取用器因为是用户发起,一般忽略 robots.txt 规则[F01];OpenAI 对 ChatGPT-User 的表述是"因为这些动作由用户发起,robots.txt 规则可能不适用"[F08];Perplexity 对 Perplexity-User 的表述是"由于是用户请求的取用,该取用器一般忽略 robots.txt 规则"[F13]。要拦这一类只能落到服务器或 WAF 层,用 robots.txt 是打空拳。反过来说,这也意味着你在 robots.txt 里的"拦训练"动作,不会误伤客户当场让 AI 打开你官网这个场景。

  4. 红线四:别拿 IP 封禁替代 robots.txt。Anthropic 官方直接点名了这个坑:仅封禁 Anthropic 机器人所用的 IP 段等替代做法可能不奏效、也不能持续保证退出生效,因为这会妨碍我们读取你的 robots.txt;正确的退出方式就是改 robots.txt[F11]。同理,UA 字符串本身可以被伪造——Google、Common Crawl、百度都在官方文档里提醒要用反查 DNS 或官方发布的 IP 段来验证真伪[F02][F19][F21]。验证真伪用 IP/DNS,表达意愿用 robots.txt,两件事别对调。

四、Google 侧的特殊性:AI 露出控制走的是展示层

Google 这一格值得单独说,因为它和其他厂商的逻辑不一样。

官方立场是:AI 已内建于搜索,AI Overviews 与 AI Mode 就是 Google 搜索的一部分,因此 Googlebot 的 robots.txt 指令就是站点所有者管理抓取的控制手段;要限制页面内容在搜索中的呈现,用 nosnippetdata-nosnippetmax-snippetnoindex[F05]。也就是说,没有一个"只拦 AI Overviews、不拦普通搜索"的开关

这些展示层控制到底怎么作用于 AI,官方在 robots meta 规范里写得很具体:

  • nosnippet——除了不显示文字摘要与视频预览,还会阻止内容被用作 AI Overviews 与 AI Mode 的直接输入[F04]。
  • max-snippet:[number]——限制字符数的同时,也会限制内容可被用作 AI Overviews 与 AI Mode 直接输入的量;该限制适用于网页搜索、图片、Discover、Assistant、AI Overviews、AI Mode 等所有形式[F04]。
  • 规则冲突时,更严格的规则生效——同时写了 max-snippet:50nosnippet,则 nosnippet 生效[F04]。

另一条容易被误读的是 Google-Extended。它没有独立的 HTTP UA 字符串,抓取仍由现有 Google UA 完成,这个令牌只在 robots.txt 里起控制作用;它管的是训练与 grounding,不影响站点在 Google 搜索中的收录,也不作为排名信号[F03]。所以"拦了 Google-Extended 会不会掉排名"这个常见顾虑,官方已直接否定。

Apple 侧则给出了另一种边界示范:即使你屏蔽了 Applebot-Extended、又给内容打了 nosnippet,你的站点规则仍可能允许 Applebot 抓取网页,内容依旧可通过 Spotlight、Siri、Safari 及 Apple 设备的系统级功能被发现[F15]。还有一条给没写全 robots.txt 的站点的默认行为:如果 robots 指令没提到 Applebot 但提到了 Googlebot,Apple 的机器人会遵循 Googlebot 的指令;另外 Applebot 不遵守 crawl-delay[F18]。而 Anthropic 是支持非标准的 Crawl-delay 扩展的[F11]——限速这件事各家不统一,别用一套写法套所有 bot。

五、四问决策法与上线核对清单

兆派在 B2B 官网运维项目里用下面四个问题落定每一格,避免"看到一篇文章说要拦就全拦了"。

问题判断依据倾向结论
Q1 这块内容是拿来获客的吗?产品页、方案页、案例页、行业内容——都是搜索型与用户触发型全部放行
Q2 有没有别处买不到的第一方资产?自有测试数据、项目实测参数、原创图库、成体系的方法论文档训练型可考虑屏蔽,但先想清楚 Q3
Q3 屏蔽训练能换来什么可衡量的东西?官方口径下,屏蔽训练型不改变当下搜索与用户触发场景的曝光[F03][F07]换不来流量,只换"不进模型权重"这一条
Q4 站内有需要真正保密的内容吗?报价单、客户名单、内部文档、未发布资料这类根本不该放在公开可抓取的 URL 上,用权限而非 robots.txt 解决

特别提醒 Q4。robots.txt 是一份公开文件,任何人都能读;在里面 Disallow 一个敏感目录,等于把该目录名字公之于众。真正的保密靠登录鉴权与访问控制,不靠爬虫协议。

上线核对清单(改完 robots.txt 当天走一遍):

  1. 文件位置在站点顶级目录,且只对同一主机、协议、端口生效——https://example.com/robots.txthttps://www.example.com/http://example.com/生效,多域名/多子域要各配一份[F16]。
  2. 文件为 UTF-8 纯文本;Google 会忽略无效行(含开头的 BOM);文件大小上限 500 KiB,超出部分被忽略[F17]。
  3. 逐个专属组回读:该组内是否补全了原本写在 User-agent: * 下的必要屏蔽规则(红线一)。
  4. 用官方工具实测:Google 侧用 Search Console 的网址检查工具,看 Googlebot 实际收到的 HTML 里展示层标记是否可见[F05]。
  5. 等待 24 小时以上再看日志与效果,别当天下结论[F09][F12][F17]。
  6. 如站点在 CDN/WAF 后面:确认放行规则同时匹配 UA 字符串 + 官方发布的 IP 段(Perplexity 官方给出的 WAF 配置建议就是两个条件组合,并定期从官方 JSON 端点同步 IP)[F14]。

六、兆派站点现状示例:默认全放行长什么样

为了让"起点"具体,这里公开我们自己站点的现状。核验时间 2026-08-04https://www.zhaopai.pub/robots.txt 返回 200,全文只有一个 User-agent: * 组:屏蔽后台入口与若干接口/交互脚本(避免产生重复内容),显式允许静态资源与上传目录,末尾声明站点地图绝对地址。

没有任何一条针对 AI 抓取器的专属规则。这意味着 OAI-SearchBot、GPTBot、ClaudeBot、PerplexityBot、Applebot、CCBot 目前全部按通配组处理——除了被屏蔽的后台与接口路径,其余内容一律放行,包括训练用途。

这是一个刻意选择而非疏忽:作为以内容获客为主的 B2B 站点,我们判断搜索型与用户触发型的曝光价值远高于"不被拿去训练"的收益,而站内不存在需要保密的第一方数据(真正的项目资料与客户信息从不放在公开 URL 上,对应上面的 Q4)。如果你的站点情况不同——比如核心资产是一套独家的技术参数库——结论就该不同。这正是这张表要你自己填的原因。

顺带一提,图片资产有它自己的一套可发现性与下架控制逻辑,和本文的抓取器授权是两层,具体见官网图片怎么被搜索正确处理?可发现性、语义署名与四种下架方式对照;改版换域名时 robots.txt 会随主机一起变更,别漏改,参见网站改版迁移怎么不掉流量?URL映射10字段、重定向红线与Google百度双平台工具口径

七、常见问题

拦掉训练型抓取器会掉搜索排名吗?
就 Google 而言,官方明确 Google-Extended 不影响站点在 Google 搜索中的收录,也不作为排名信号[F03]。OpenAI 侧 GPTBot 与 OAI-SearchBot 是相互独立的设置,可以只屏蔽训练而保留搜索露出[F06][F07]。

放行了搜索型抓取器,就能保证被 AI 引用吗?
不能。OpenAI 官方写明公开或允许抓取并不保证展示、排名或引用;Google 也在文档中说明,即便页面满足全部要求与政策,也不代表 Google 就会抓取、索引或提供其内容,索引与呈现均无保证[F05]。任何承诺"必被 AI 引用"的说法都没有官方依据。

需要为 AI 单独做 llms.txt 或专用结构化数据吗?
Google 官方对 AI 功能的表述是:无需创建新的机器可读文件、AI 文本文件或标记,也不存在需要额外添加的特殊 schema.org 结构化数据[F05]。把力气花在内容本身与基础技术可发现性上更实在。

我怎么知道哪些爬虫真的来过、又是否遵守了规则?
看服务器日志里的 UA 与 IP,并用各家官方发布的 IP 段或反查 DNS 验证真伪[F02][F19][F21]。若站点在 Cloudflare 后面,其 AI Crawl Control 提供了追踪 robots.txt 健康度、识别哪些爬虫违反指令的能力[F23]——这属于执行层工具,不改变前面各家官方规则本身。

Bing 侧怎么办?
本次核验未能取到微软官方关于 AI 相关抓取器的可用说明页,因此本文不对 Bing 侧给出结论。涉及 Bing 时请以 Bing 网站管理员工具官方文档的当期说明为准,不要把其他平台的令牌套用过去。

来源与说明

本文平台规则部分逐条对应下列官方文档,均核验至 2026-08-04:

  • [F01][F02][F03] Google《Overview of Google crawlers and fetchers》《List of Google's common crawlers》《List of Google user-triggered fetchers》
  • [F04] Google《Robots Meta Tags Specifications》(robots meta、data-nosnippet 与 X-Robots-Tag)
  • [F05] Google《AI features and your website》
  • [F16][F17] Google《How Google interprets the robots.txt specification》
  • [F06]–[F09] OpenAI《Overview of OpenAI Crawlers》
  • [F10][F11] Anthropic《Does Anthropic crawl data from the web, and how can site owners block the crawler?》(更新日期 2026-04-07)
  • [F12]–[F14] Perplexity《Perplexity Crawlers》
  • [F15][F18] Apple《About Applebot》
  • [F19] Common Crawl《CCBot》
  • [F20][F21] 百度用户服务中心《FAQs of Baiduspider》
  • [F22][F23] Cloudflare《Bots》《AI Crawl Control》(厂商执行层文档,非搜索平台官方规则)

抓取器名单与令牌属于高频变动信息,各厂商可能随时新增或更名。本文不承诺排名、收录或被任何 AI 系统引用;实施前请以你实施当天的各平台官方文档为准复核。


    兆派展览展示
    作者

    兆派展览展示

    欢迎来到兆派国际展览官方网站

    在线留言

    验证码