一句话结论:你在服务器日志里找不到「豆包爬虫」「元宝爬虫」「DeepSeek 爬虫」——国内 AI 助手大多不自建面向答案的爬虫,而是复用母体搜索索引或购买第三方搜索 API。你能看到、也应该去看的是这几个:Bytespider(字节 / 头条搜索)、Baiduspider(百度 AI)、Sogou web spider(元宝所在的腾讯搜索生态)、YisouSpider(神马 / 夸克 / UC 系)、PetalBot(华为),海外则是 GPTBot / OAI-SearchBot / ChatGPT-User / ClaudeBot / PerplexityBot。而且最关键的一条口径是:日志只能证明”被抓走”,证明不了”被引用”。
为什么这篇要重写一遍:中文互联网上关于爬虫 UA 的内容,几乎全部停留在 2019–2024 年的 SEO 时代——CSDN、掘金、博客园上的「搜索引擎蜘蛛 UA 大全」,框架清一色是怎么把它们挡掉、省带宽、防采集。AI 时代的问法正好反过来:我想被抓到,我怎么确认它真的来了、抓的是什么、有没有被我自己的 WAF 拦在门外。 这两个问题的答案完全不同,但没有一篇中文文章转过这个弯。
一、先纠正前提:日志里没有「豆包爬虫」这种东西
这是最多人卡住的第一步——打开日志 grep -i doubao,一条都没有,于是得出「豆包没抓过我」的错误结论。
真实结构是这样的:「谁在答问题」和「谁在爬网页」在国内基本是两拨人。 大部分国内 AI 助手要么复用母公司搜索引擎的现成索引,要么直接买第三方搜索 API 做联网检索,而不是自己派一支署名爬虫上门。
| AI 引擎 | 网页内容实际由谁抓 / 从哪来 | 你日志里会看到的 UA | 能不能验真 |
|---|---|---|---|
| 豆包(字节) | 字节体系的抓取(头条搜索站长平台署名) | Bytespider | ✅ 反查 IP 主机名属 crawl.bytedance.com |
| 百度 AI / 文心 | 百度搜索索引 | Baiduspider | ✅ rDNS 应为 *.baidu.com / *.baidu.jp |
| 腾讯元宝 | 微信搜一搜 + 搜狗搜索生态;公众号内容走微信内部 | Sogou web spider(公众号内容不经公开爬虫) | ⚠️ 部分可验,公众号那条链路日志里看不到 |
| 夸克 / 通义(阿里、UC 系) | 神马搜索索引 | YisouSpider | ⚠️ 无官方机读 IP 文件 |
| DeepSeek | 无自有爬虫,联网检索由第三方搜索 API 提供(公开报道为博查 Bocha) | 无 | — |
| Kimi(月之暗面) | 有第三方文档记录到 Kimibot/1.0,但官方未见公开说明 | Kimibot(存疑,以自己日志为准) | ❌ |
| 华为小艺 / Petal | Petal 搜索 | PetalBot | ⚠️ |
三条直接可用的结论:
- 想被豆包看见,动作是”进字节的抓取体系”,不是”等豆包爬虫”。
- 想被元宝看见,主战场是微信公众号,不是你的官网日志——公众号内容进元宝的路径根本不经过你的服务器,所以日志里怎么找都找不到(这条链路怎么走,见公众号内容进元宝的实操指南)。
- DeepSeek 的日志缺席不是坏消息,是结构使然——它不自己爬。你要影响的是它背后那个搜索 API 的收录范围,以及它引用得最多的那批平台(DeepSeek 优化详解)。
关于 Bytespider 的一次正名(以及一句必须说清的话)
站长最常见的困惑是:Bytespider 的 UA 里挂的是 https://zhanzhang.toutiao.com/——头条搜索的站长平台。那它抓走的东西到底喂不喂豆包?
可核实的部分:这个 UA 由字节体系使用,署名指向头条搜索站长平台;反查它的 IP,主机名形如 bytespider-<ip>.crawl.bytedance.com,确实属于字节。国际上的 AI 爬虫清单普遍把 Bytespider 归为字节的 AI 训练抓取。
不可核实的部分:字节从未公开说明头条搜索的抓取与豆包答案语料之间的具体关系。 所以正确的表述是——Bytespider 来过,说明你进了字节体系的候选池;它推不出「豆包会引用你」。任何声称”日志里有 Bytespider = 豆包收录了你”的说法,都是在替字节做它自己没做过的承诺。
验证方法上也要提醒一句:网上流传的所谓「Bytespider 官方 IP 段」多数出自多年前的第三方博客,来源与时效都无法核实,不要拿来做放行名单。本文只保留 rDNS 双向验证这一条;是否有官方 IP 段清单与验证工具,以头条搜索站长平台的官方说明为准。
二、国内这几个 UA,逐条怎么看
Bytespider(字节 / 头条搜索)
UA 有 PC、Android、iOS 三种形态,共同点是括号里的 compatible; Bytespider; https://zhanzhang.toutiao.com/:
Mozilla/5.0 (Linux; Android 5.0) AppleWebKit/537.36 (KHTML, like Gecko) Mobile Safari/537.36 (compatible; Bytespider; https://zhanzhang.toutiao.com/)
Mozilla/5.0 (iPhone; CPU iPhone OS 7_1_2 like Mac OS X) AppleWebKit/537.36 (KHTML, like Gecko) Version/7.0 Mobile Safari/537.36 (compatible; Bytespider; https://zhanzhang.toutiao.com/)
Mozilla/5.0 (compatible; Bytespider; https://zhanzhang.toutiao.com/) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.0.0 Safari/537.36
抓取强度历来偏猛,这也是 2019 年之后一大批中文教程教人把它封掉的原因。如果你现在的目标是被 AI 看见,第一件事就是去 robots.txt 里确认当年有没有封过它。
Baiduspider(百度 AI / 文心)
国内唯一验证路径最清晰的一个:官方 UA 为 Baiduspider,验真做反向 DNS + 正向 DNS 双向确认——IP 反查主机名应以 *.baidu.com 或 *.baidu.jp 结尾,再把该主机名正解回去,必须解析回同一个 IP。百度 AI 与百度搜索生态强绑定,所以这一条 UA 的价值最高(对应打法见百度 AI / 文心一言 SEO)。
Sogou web spider(腾讯搜索生态 / 元宝的一半)
典型 UA 形如 Sogou web spider/4.0(+http://www.sogou.com/docs/help/webmasters.htm#07)。元宝的信源结构里,公网这一半来自搜狗与腾讯新闻生态,另一半——也是更重的一半——来自微信搜一搜和公众号,后者在你的日志里是完全隐形的(元宝优化)。
YisouSpider(神马 / 夸克 / UC 系)
UA 直接包含 YisouSpider。它在中文站长圈的名声很差——被大量投诉抓取过猛、对 robots.txt 的遵守情况被反复质疑。注意这里有个新的判断题:以前把它当”消耗带宽的坏蜘蛛”封掉是合理的;现在夸克是国内主要的 AI 搜索入口之一,封掉它等于自断一条链路。要不要放开,取决于你的服务器扛不扛得住,而不是取决于 2021 年那篇教程。
PetalBot(华为)、360Spider(360 / 纳米 AI):同理,属于”顺手要看一眼”的一档。
共同的安全前提:UA 可以伪造。 User-Agent 只是请求方自己填的一串文本,采集器伪装成知名爬虫以绕过限速是常规操作。放行名单必须以 IP 验证为准,UA 只能用来做初筛。
三、海外那边正好相反:分工清楚、IP 可机读
跨境品牌会发现海外这套完全是另一种设计——同一家公司派不同的 bot 干不同的事,而且公布机读 IP 文件让你验真。
| 爬虫 UA | 归属 | 用途 | 验真方式 |
|---|---|---|---|
GPTBot | OpenAI | 训练语料抓取 | openai.com/gptbot.json |
OAI-SearchBot | OpenAI | ChatGPT 搜索的检索抓取(不用于训练) | openai.com/searchbot.json |
ChatGPT-User | OpenAI | 用户在会话中触发的实时抓取 | openai.com/chatgpt-user.json |
ClaudeBot | Anthropic | 训练语料抓取 | anthropic.com/robots-allowlist.json(以官方页面为准) |
Claude-User / Claude-SearchBot | Anthropic | 用户触发 / 检索 | 同上 |
PerplexityBot | Perplexity | 检索索引 | perplexity.ai/perplexitybot.json |
Perplexity-User | Perplexity | 用户触发的实时抓取 | perplexity.ai/perplexity-user.json |
Google-Extended | 不是爬虫,是 robots.txt 里的训练用途开关 | — |
这张表里最该记住的一件事,是”训练型”和”检索型”必须分开看:
- 训练型(GPTBot、ClaudeBot、CCBot)抓走的内容进模型权重,不会给你引用,也不会给你链接;
- 检索型(OAI-SearchBot、Claude-SearchBot、PerplexityBot)是为了在答案里引用并链接你而抓的。
所以当你在日志里看到 AI 爬虫暴涨、却一点流量没多,不必意外——这两类的商业含义天差地别。海外那套信源逻辑和国内的差别,我们在出海品牌的双栈信源对照里拆过。
四、怎么把它们从日志里真的捞出来
日志是唯一能完整看到 AI bot 的地方——它不依赖 JavaScript,所以 GA4、百度统计天然看不到爬虫。
① 先看谁来了(按 UA 关键词汇总,nginx / apache 通用)
grep -aiE "bytespider|baiduspider|sogou|yisouspider|petalbot|360spider|gptbot|oai-searchbot|chatgpt-user|claudebot|claude-user|claude-searchbot|perplexitybot|perplexity-user|bingbot|applebot|amazonbot|ccbot" access.log \
| awk -F'"' '{print $6}' \
| sed -E 's/.*(Bytespider|Baiduspider|Sogou web spider|YisouSpider|PetalBot|360Spider|GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|bingbot|Applebot|Amazonbot|CCBot).*/\1/I' \
| sort | uniq -c | sort -rn
② 再看它们抓了什么(这一步比第一步重要)
grep -ai "bytespider" access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -30
如果它反复抓的全是分页、标签页、搜索结果页,而你真正想被引用的产品页 / 对比页 / FAQ 页一次没进过——这不是”被抓到了”,这是抓错了地方。
③ 最容易被忽略的一步:看状态码
grep -aiE "gptbot|bytespider|perplexitybot|claudebot|baiduspider" access.log \
| awk '{print $9}' | sort | uniq -c | sort -rn
大量 403(被 WAF / CDN 拦了)、429(限速)、404、5xx——这是最常见、也最贵的一种”隐形失败”:AI 爬虫来了,被你自己的防护规则挡在门外,而你在监测端只看到”没被引用”,永远查不出原因。现在几乎所有主流 CDN 都内置了 AI bot 管理开关,很多默认是拦的。
④ 验真(放行名单一律用这一步的结果)
# 反向 + 正向 DNS 双向验证
host <日志里那条记录的源 IP> # Bytespider 期望:*.crawl.bytedance.com
host <日志里那条记录的源 IP> # Baiduspider 期望:*.baidu.com / *.baidu.jp
# 反查出的主机名,再正解回去,必须等于原 IP
# 有机读 IP 文件的直接对表
curl -s https://openai.com/gptbot.json
curl -s https://www.perplexity.ai/perplexitybot.json
五、最重要的一节:被抓 ≠ 被引用
这是本文与所有「蜘蛛 UA 大全」最根本的区别,也是最容易被服务商拿来糊弄甲方的地方(“你看,AI 爬虫抓了 8 万次,说明我们的 GEO 有效果”)。
用数据说话。 Cloudflare Radar 2026 年 1–3 月的抓取/引荐比(crawl-to-refer ratio):
| 爬虫 | 抓多少页 → 才带回 1 次访问 |
|---|---|
| ClaudeBot | 约 23,951 : 1 |
| GPTBot | 约 1,276 : 1 |
| PerplexityBot | 约 192.9 : 1 |
| Googlebot | 约 5.2 : 1 |
| DuckAssistBot | 约 1.5 : 1 |
同一份数据还给出一个更本质的比例:2026 年 5 月,“可能产生引用”的检索型抓取只占 AI 爬虫请求的不到 10%,其余 90% 是纯提取。
(口径提醒:AI 客户端 App 打开链接时常常不带 Referer,所以这类比值会高估失衡程度——但即便打上这个折扣,量级结论也不变。这个”referer 丢失”的问题,正是中国 AI 引擎引荐流量识别指南那一篇的主题,本文是它的上游镜像:那篇讲 AI 带来的流量怎么认,这篇讲 AI 抓走的东西怎么认。)
所以正确的因果链是四段,日志只覆盖第一段:
① 被抓到(日志能证明)
↓
② 进入该引擎的候选池(日志证明不了)
↓
③ 在具体问题下被选中写进答案(只能靠问答实测)
↓
④ 答案里给出可点的链接(很多国内 App 面根本不给)
第 ④ 关我们实测过:豆包的 API、网页、App 三个面给出的引用不是同一套,App 面通常只显示来源标题、不给精确 URL(三面引用实测)。这意味着——哪怕日志显示你被抓得很勤,App 上的真实用户也可能永远看不到指向你的链接。
一句话记法:日志是”入口体检”,监测是”结果体检”,两个都要做,但别拿前者当后者的成绩单。 结果侧怎么测、测哪几个指标,见国内 AI 可见度监测指南;名词口径见GEO 术语表。
六、顺带回答:llms.txt 到底要不要做
既然在讲”怎么让 AI 抓得舒服”,这个问题一定会被问到。数据很干脆:
- Ahrefs 分析 13.7 万个站点,97% 的 llms.txt 文件从未被 AI 爬虫读取过;
- 另一份统计里,5.15 亿次 AI bot 事件中只有 408 次请求真的落在
/llms.txt上; - 国内厂商(文心 / 豆包 / 通义 / DeepSeek)的官方文档至今对 llms.txt 零提及。
结论:做,但 10 分钟做完就走,别立项。 它成本极低、不会有负面影响,万一将来成了标准你已经在了;但把它当成 GEO 主线动作,是把力气花在了一个 0.0001% 命中率的文件上。真正值钱的三件事在下一节。
七、想被抓到,该做的七件事(不是防采集,是开门)
- 翻一遍 robots.txt 的历史遗留封禁。 2019–2024 年的中文教程教了整整一代站长去封
Bytespider、YisouSpider、Sogou web spider。这些规则今天还躺在很多站的根目录里,而它们现在封的是 AI 入口。逐条重新决策,别继承。 - 翻 CDN / WAF 的 bot 管理规则。 比 robots.txt 更隐蔽——robots.txt 是”请你别来”,WAF 是”直接 403”。用第四节的状态码命令查,看到成片 403 就去后台找 AI bot 分类开关。
- 分开决策训练型和检索型。 如果你介意内容被拿去训练但想要引用,可以只放行
OAI-SearchBot、PerplexityBot、Claude-SearchBot这类检索 bot,而对GPTBot、ClaudeBot、CCBot收紧。这是海外那套 UA 分工唯一的实用价值。 - 国内走站长平台主动提交,别只等爬。 百度搜索资源平台、头条搜索站长平台、搜狗站长平台、神马站长平台——这四个才是国内”让 AI 抓到你”的正门。国内引擎的语料来自母体搜索,所以传统收录动作在 AI 时代反而重新值钱了。
- 别把关键事实藏在 JS 里。 多数爬虫不执行 JavaScript,前端渲染出来的价格、参数、FAQ 在它们眼里等于不存在。服务端渲染或静态化你最想被引用的那几页。
- 元宝这条链路不在你的服务器上。 它主要吃微信生态,日志里看不到就是正常的——对应的动作是公众号,不是 robots.txt。
- 每月复查一次。 UA 会变、IP 段会变、CDN 会推送新的默认 bot 规则。规则失效的时候不会报错,它只会安静地让你消失。
八、15 分钟自查清单
- 跑第四节 ① 号命令,看过去 30 天到底有哪些 AI / 搜索 bot 来过,各多少次
- 跑 ③ 号命令看状态码:有没有成片的 403 / 429(先修这个,其他都靠后)
- 打开 robots.txt,逐条确认有没有历史遗留的
Bytespider/YisouSpider/Sogou/GPTBot封禁 - 打开 CDN 控制台,确认 AI bot 管理是”拦截”还是”放行”
- 跑 ② 号命令:它们抓的是不是你最想被引用的那几页
- 抽 2–3 个 IP 做 rDNS 双向验证,确认不是伪装流量
- 四个国内站长平台各确认一次收录状态
- 最后一步,也是唯一能回答”到底有没有效”的一步:去豆包 / DeepSeek / 元宝 / 百度 AI 各问 3 个真实用户会问的问题,记下提没提你、引了谁
常见问题(FAQ)
服务器日志里能看到「豆包爬虫」「元宝爬虫」吗?
看不到,基本不存在这样一个 UA。国内 AI 助手大多复用母体搜索索引或买第三方搜索 API:豆包这边是 Bytespider(署名头条搜索站长平台),百度 AI 是 Baiduspider,元宝走微信搜一搜与搜狗生态,夸克/通义那侧是 YisouSpider,DeepSeek 则无自有爬虫。
日志里出现 Bytespider,是不是说明豆包会引用我? 不能这样推。可核实的只有 UA 署名头条搜索站长平台、IP 反查属字节抓取域;字节从未公开说明它与豆包答案语料的关系。它只能证明你进了候选池。
UA 里写着 GPTBot,就一定是 OpenAI 吗?
不一定,UA 可以随便伪造。验真只有两条路:比对厂商公布的机读 IP 文件(openai.com/gptbot.json、perplexity.ai/perplexitybot.json),或做 rDNS + 正向 DNS 双向验证。放行名单一律以 IP 为准。
被 AI 爬虫抓过,等于被 AI 引用了吗? 不等于。Cloudflare Radar 2026 年 1–3 月数据:ClaudeBot 约抓 23,951 页才带回一次访问,GPTBot 约 1,276:1,Googlebot 只有约 5.2:1。日志证明”被抓走”,证明不了”被写进答案”。
要不要为了被 AI 抓到而做 llms.txt? 可以做,但别当项目做。97% 的 llms.txt 从未被读取,5.15 亿次 AI bot 事件里只有 408 次命中,国内厂商官方文档零提及。10 分钟做完就去修 robots.txt 和 WAF。
AI 爬虫把服务器抓崩了怎么办?
用限速(rate limit)而不是全封。对已验真的 bot 设合理的 QPS 上限、给静态资源上缓存,比一刀切 Disallow: / 好——后者省下的是带宽,赔进去的是入口。
参考来源
- Cloudflare Blog:AI 搜索的抓取/引荐比(crawl-to-refer ratio) —— ClaudeBot 23,951:1、GPTBot 1,276:1、Googlebot 5.2:1 等数据(2026 年 1–3 月)
- Ahrefs:分析 13.7 万个站点,97% 的 llms.txt 从未被读取
- PPC Land:llms.txt 采用率上升 8.8 倍,但 97% 的文件零请求
- OpenAI 爬虫与 UA 说明(GPTBot / OAI-SearchBot / ChatGPT-User 及三个 IP JSON)
- Perplexity 爬虫 UA 与 IP 文件说明
- Jademond:Baiduspider 的 UA、robots.txt 与 rDNS 验证指南
- 泪雪博客:头条搜索蜘蛛 Bytespider 的三种 UA 与站长平台署名变更
- 泪雪博客:神马搜索蜘蛛 YisouSpider 说明
- 和讯:腾讯元宝接入微信搜一搜,覆盖公众号内容(2024-05-30)
- 36 氪:为 DeepSeek 提供联网搜索的博查(Bocha)
- 保哥笔记:AI 爬虫抓取量已超 Googlebot 3.6 倍
本文涉及的 UA 字符串、IP 归属与厂商文档均以各厂商官方页面的当前版本为准;爬虫标识与 IP 段会变更,建议每月复核一次。
日志能告诉你”门开着”,但打不开”AI 到底怎么说你”这一层。闻响 GeoEcho 同时监测你在国内(豆包 / DeepSeek / Kimi / 元宝 / 百度)和海外(ChatGPT / Perplexity / Gemini)引擎里的提及率、推荐率与引用来源——输入域名,30 秒出一份免费快照,不用约销售。
常见问题
服务器日志里能看到「豆包爬虫」「元宝爬虫」吗?
看不到,因为基本不存在这样一个 UA。国内 AI 助手大多不为「答问题」单独养一支爬虫,而是复用母体搜索的索引或买第三方搜索 API:豆包这边你会看到的是字节的 Bytespider(UA 里挂着 zhanzhang.toutiao.com,即头条搜索站长平台),元宝走的是微信搜一搜与搜狗生态,夸克/通义那侧是神马的 YisouSpider,百度 AI 用的是 Baiduspider。DeepSeek 则公开借助第三方搜索 API(如博查)联网,你的日志里根本不会出现「DeepSeekBot」。
日志里出现 Bytespider,是不是说明豆包会引用我?
不能这样推。可核实的只有两件事:这个 UA 指向头条搜索站长平台,反查 IP 的主机名属于 bytedance.com 的抓取域。字节从未公开说明头条搜索的抓取与豆包答案语料之间的具体关系,所以「Bytespider 来过」最多只能证明你进入了字节体系的候选池,证明不了你会出现在豆包的答案里。要确认后者,只能直接去问豆包并记录结果。
UA 里写着 GPTBot,就一定是 OpenAI 吗?
不一定,User-Agent 是请求方自己填的字符串,可以随便伪造,采集器伪装成 AI 爬虫以绕过限速是常见做法。要验真只有两条路:一是拿源 IP 去比对厂商公布的机读 IP 文件(OpenAI 在 openai.com/gptbot.json、searchbot.json、chatgpt-user.json 三个文件里公布,Perplexity 在 perplexity.ai/perplexitybot.json 公布);二是做反向 DNS + 正向 DNS 双向验证(Baiduspider 应解析到 *.baidu.com 或 *.baidu.jp)。放行名单一律以 IP 为准,不要以 UA 为准。
被 AI 爬虫抓过,等于被 AI 引用了吗?
完全不等于,这是这篇文章最重要的一条口径。按 Cloudflare Radar 2026 年 1–3 月的数据,ClaudeBot 平均抓约 23,951 个页面才带回一次访问,GPTBot 约 1,276:1,Perplexity 约 192.9:1,而 Googlebot 只有约 5.2:1。日志能证明的只有「我被抓走了」,证明不了「我被写进答案」。中间还隔着进候选池、被选中、被给出链接三道关。
要不要为了被 AI 抓到而做 llms.txt?
可以做,但别当项目做。Ahrefs 分析 13.7 万个站发现 97% 的 llms.txt 文件从未被 AI 爬虫读取过;另一份 5.15 亿次 AI bot 事件的统计里,只有 408 次请求真的落在 /llms.txt 上。国内厂商(文心、豆包、通义、DeepSeek)的官方文档至今没有提到过这个文件。它的成本是 10 分钟,收益接近于零但不为负——做完就去做真正有用的:robots.txt 别误封、CDN 别误拦、站长平台把内容提交进去。