guide

怎么从服务器日志确认豆包、元宝真的抓过你的站:国内 AI 爬虫 UA 与验证清单(2026)

中文互联网上的「蜘蛛 UA 大全」全是防采集视角,答的是上一个时代的问题。本文从「我想被 AI 抓到」出发:日志里为什么找不到「豆包爬虫」、国内各引擎实际由谁代抓、UA 怎么验真(UA 可伪造)、以及最关键的一条口径——被抓 ≠ 被引用。

怎么从服务器日志确认豆包、元宝真的抓过你的站:国内 AI 爬虫 UA 与验证清单(2026)

一句话结论:你在服务器日志里找不到「豆包爬虫」「元宝爬虫」「DeepSeek 爬虫」——国内 AI 助手大多不自建面向答案的爬虫,而是复用母体搜索索引或购买第三方搜索 API。你能看到、也应该去看的是这几个:Bytespider(字节 / 头条搜索)、Baiduspider(百度 AI)、Sogou web spider(元宝所在的腾讯搜索生态)、YisouSpider(神马 / 夸克 / UC 系)、PetalBot(华为),海外则是 GPTBot / OAI-SearchBot / ChatGPT-User / ClaudeBot / PerplexityBot。而且最关键的一条口径是:日志只能证明”被抓走”,证明不了”被引用”。

为什么这篇要重写一遍:中文互联网上关于爬虫 UA 的内容,几乎全部停留在 2019–2024 年的 SEO 时代——CSDN、掘金、博客园上的「搜索引擎蜘蛛 UA 大全」,框架清一色是怎么把它们挡掉、省带宽、防采集。AI 时代的问法正好反过来:我想被抓到,我怎么确认它真的来了、抓的是什么、有没有被我自己的 WAF 拦在门外。 这两个问题的答案完全不同,但没有一篇中文文章转过这个弯。


一、先纠正前提:日志里没有「豆包爬虫」这种东西

这是最多人卡住的第一步——打开日志 grep -i doubao,一条都没有,于是得出「豆包没抓过我」的错误结论。

真实结构是这样的:「谁在答问题」和「谁在爬网页」在国内基本是两拨人。 大部分国内 AI 助手要么复用母公司搜索引擎的现成索引,要么直接买第三方搜索 API 做联网检索,而不是自己派一支署名爬虫上门。

AI 引擎网页内容实际由谁抓 / 从哪来你日志里会看到的 UA能不能验真
豆包(字节)字节体系的抓取(头条搜索站长平台署名)Bytespider✅ 反查 IP 主机名属 crawl.bytedance.com
百度 AI / 文心百度搜索索引Baiduspider✅ rDNS 应为 *.baidu.com / *.baidu.jp
腾讯元宝微信搜一搜 + 搜狗搜索生态;公众号内容走微信内部Sogou web spider(公众号内容不经公开爬虫)⚠️ 部分可验,公众号那条链路日志里看不到
夸克 / 通义(阿里、UC 系)神马搜索索引YisouSpider⚠️ 无官方机读 IP 文件
DeepSeek无自有爬虫,联网检索由第三方搜索 API 提供(公开报道为博查 Bocha)
Kimi(月之暗面)有第三方文档记录到 Kimibot/1.0,但官方未见公开说明Kimibot(存疑,以自己日志为准)
华为小艺 / PetalPetal 搜索PetalBot⚠️

三条直接可用的结论:

  1. 想被豆包看见,动作是”进字节的抓取体系”,不是”等豆包爬虫”。
  2. 想被元宝看见,主战场是微信公众号,不是你的官网日志——公众号内容进元宝的路径根本不经过你的服务器,所以日志里怎么找都找不到(这条链路怎么走,见公众号内容进元宝的实操指南)。
  3. DeepSeek 的日志缺席不是坏消息,是结构使然——它不自己爬。你要影响的是它背后那个搜索 API 的收录范围,以及它引用得最多的那批平台(DeepSeek 优化详解)。

关于 Bytespider 的一次正名(以及一句必须说清的话)

站长最常见的困惑是:Bytespider 的 UA 里挂的是 https://zhanzhang.toutiao.com/——头条搜索的站长平台。那它抓走的东西到底喂不喂豆包?

可核实的部分:这个 UA 由字节体系使用,署名指向头条搜索站长平台;反查它的 IP,主机名形如 bytespider-<ip>.crawl.bytedance.com,确实属于字节。国际上的 AI 爬虫清单普遍把 Bytespider 归为字节的 AI 训练抓取。

不可核实的部分字节从未公开说明头条搜索的抓取与豆包答案语料之间的具体关系。 所以正确的表述是——Bytespider 来过,说明你进了字节体系的候选池;它推不出「豆包会引用你」。任何声称”日志里有 Bytespider = 豆包收录了你”的说法,都是在替字节做它自己没做过的承诺。

验证方法上也要提醒一句:网上流传的所谓「Bytespider 官方 IP 段」多数出自多年前的第三方博客,来源与时效都无法核实,不要拿来做放行名单。本文只保留 rDNS 双向验证这一条;是否有官方 IP 段清单与验证工具,以头条搜索站长平台的官方说明为准。


二、国内这几个 UA,逐条怎么看

Bytespider(字节 / 头条搜索) UA 有 PC、Android、iOS 三种形态,共同点是括号里的 compatible; Bytespider; https://zhanzhang.toutiao.com/

Mozilla/5.0 (Linux; Android 5.0) AppleWebKit/537.36 (KHTML, like Gecko) Mobile Safari/537.36 (compatible; Bytespider; https://zhanzhang.toutiao.com/)
Mozilla/5.0 (iPhone; CPU iPhone OS 7_1_2 like Mac OS X) AppleWebKit/537.36 (KHTML, like Gecko) Version/7.0 Mobile Safari/537.36 (compatible; Bytespider; https://zhanzhang.toutiao.com/)
Mozilla/5.0 (compatible; Bytespider; https://zhanzhang.toutiao.com/) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.0.0 Safari/537.36

抓取强度历来偏猛,这也是 2019 年之后一大批中文教程教人把它封掉的原因。如果你现在的目标是被 AI 看见,第一件事就是去 robots.txt 里确认当年有没有封过它。

Baiduspider(百度 AI / 文心) 国内唯一验证路径最清晰的一个:官方 UA 为 Baiduspider,验真做反向 DNS + 正向 DNS 双向确认——IP 反查主机名应以 *.baidu.com*.baidu.jp 结尾,再把该主机名正解回去,必须解析回同一个 IP。百度 AI 与百度搜索生态强绑定,所以这一条 UA 的价值最高(对应打法见百度 AI / 文心一言 SEO)。

Sogou web spider(腾讯搜索生态 / 元宝的一半) 典型 UA 形如 Sogou web spider/4.0(+http://www.sogou.com/docs/help/webmasters.htm#07)。元宝的信源结构里,公网这一半来自搜狗与腾讯新闻生态,另一半——也是更重的一半——来自微信搜一搜和公众号,后者在你的日志里是完全隐形的(元宝优化)。

YisouSpider(神马 / 夸克 / UC 系) UA 直接包含 YisouSpider。它在中文站长圈的名声很差——被大量投诉抓取过猛、对 robots.txt 的遵守情况被反复质疑。注意这里有个新的判断题:以前把它当”消耗带宽的坏蜘蛛”封掉是合理的;现在夸克是国内主要的 AI 搜索入口之一,封掉它等于自断一条链路。要不要放开,取决于你的服务器扛不扛得住,而不是取决于 2021 年那篇教程。

PetalBot(华为)360Spider(360 / 纳米 AI):同理,属于”顺手要看一眼”的一档。

共同的安全前提:UA 可以伪造。 User-Agent 只是请求方自己填的一串文本,采集器伪装成知名爬虫以绕过限速是常规操作。放行名单必须以 IP 验证为准,UA 只能用来做初筛。


三、海外那边正好相反:分工清楚、IP 可机读

跨境品牌会发现海外这套完全是另一种设计——同一家公司派不同的 bot 干不同的事,而且公布机读 IP 文件让你验真

爬虫 UA归属用途验真方式
GPTBotOpenAI训练语料抓取openai.com/gptbot.json
OAI-SearchBotOpenAIChatGPT 搜索的检索抓取(不用于训练)openai.com/searchbot.json
ChatGPT-UserOpenAI用户在会话中触发的实时抓取openai.com/chatgpt-user.json
ClaudeBotAnthropic训练语料抓取anthropic.com/robots-allowlist.json(以官方页面为准)
Claude-User / Claude-SearchBotAnthropic用户触发 / 检索同上
PerplexityBotPerplexity检索索引perplexity.ai/perplexitybot.json
Perplexity-UserPerplexity用户触发的实时抓取perplexity.ai/perplexity-user.json
Google-ExtendedGoogle不是爬虫,是 robots.txt 里的训练用途开关

这张表里最该记住的一件事,是”训练型”和”检索型”必须分开看

  • 训练型(GPTBot、ClaudeBot、CCBot)抓走的内容进模型权重,不会给你引用,也不会给你链接
  • 检索型(OAI-SearchBot、Claude-SearchBot、PerplexityBot)是为了在答案里引用并链接你而抓的。

所以当你在日志里看到 AI 爬虫暴涨、却一点流量没多,不必意外——这两类的商业含义天差地别。海外那套信源逻辑和国内的差别,我们在出海品牌的双栈信源对照里拆过。


四、怎么把它们从日志里真的捞出来

日志是唯一能完整看到 AI bot 的地方——它不依赖 JavaScript,所以 GA4、百度统计天然看不到爬虫。

① 先看谁来了(按 UA 关键词汇总,nginx / apache 通用)

grep -aiE "bytespider|baiduspider|sogou|yisouspider|petalbot|360spider|gptbot|oai-searchbot|chatgpt-user|claudebot|claude-user|claude-searchbot|perplexitybot|perplexity-user|bingbot|applebot|amazonbot|ccbot" access.log \
  | awk -F'"' '{print $6}' \
  | sed -E 's/.*(Bytespider|Baiduspider|Sogou web spider|YisouSpider|PetalBot|360Spider|GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|bingbot|Applebot|Amazonbot|CCBot).*/\1/I' \
  | sort | uniq -c | sort -rn

② 再看它们抓了什么(这一步比第一步重要)

grep -ai "bytespider" access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -30

如果它反复抓的全是分页、标签页、搜索结果页,而你真正想被引用的产品页 / 对比页 / FAQ 页一次没进过——这不是”被抓到了”,这是抓错了地方

③ 最容易被忽略的一步:看状态码

grep -aiE "gptbot|bytespider|perplexitybot|claudebot|baiduspider" access.log \
  | awk '{print $9}' | sort | uniq -c | sort -rn

大量 403(被 WAF / CDN 拦了)、429(限速)、4045xx——这是最常见、也最贵的一种”隐形失败”:AI 爬虫来了,被你自己的防护规则挡在门外,而你在监测端只看到”没被引用”,永远查不出原因。现在几乎所有主流 CDN 都内置了 AI bot 管理开关,很多默认是拦的

④ 验真(放行名单一律用这一步的结果)

# 反向 + 正向 DNS 双向验证
host <日志里那条记录的源 IP>   # Bytespider 期望:*.crawl.bytedance.com
host <日志里那条记录的源 IP>   # Baiduspider 期望:*.baidu.com / *.baidu.jp
# 反查出的主机名,再正解回去,必须等于原 IP

# 有机读 IP 文件的直接对表
curl -s https://openai.com/gptbot.json
curl -s https://www.perplexity.ai/perplexitybot.json

五、最重要的一节:被抓 ≠ 被引用

这是本文与所有「蜘蛛 UA 大全」最根本的区别,也是最容易被服务商拿来糊弄甲方的地方(“你看,AI 爬虫抓了 8 万次,说明我们的 GEO 有效果”)。

用数据说话。 Cloudflare Radar 2026 年 1–3 月的抓取/引荐比(crawl-to-refer ratio):

爬虫抓多少页 → 才带回 1 次访问
ClaudeBot约 23,951 : 1
GPTBot约 1,276 : 1
PerplexityBot约 192.9 : 1
Googlebot约 5.2 : 1
DuckAssistBot约 1.5 : 1

同一份数据还给出一个更本质的比例:2026 年 5 月,“可能产生引用”的检索型抓取只占 AI 爬虫请求的不到 10%,其余 90% 是纯提取。

(口径提醒:AI 客户端 App 打开链接时常常不带 Referer,所以这类比值会高估失衡程度——但即便打上这个折扣,量级结论也不变。这个”referer 丢失”的问题,正是中国 AI 引擎引荐流量识别指南那一篇的主题,本文是它的上游镜像:那篇讲 AI 带来的流量怎么认,这篇讲 AI 抓走的东西怎么认。)

所以正确的因果链是四段,日志只覆盖第一段:

① 被抓到(日志能证明)

② 进入该引擎的候选池(日志证明不了)

③ 在具体问题下被选中写进答案(只能靠问答实测)

④ 答案里给出可点的链接(很多国内 App 面根本不给)

第 ④ 关我们实测过:豆包的 API、网页、App 三个面给出的引用不是同一套,App 面通常只显示来源标题、不给精确 URL(三面引用实测)。这意味着——哪怕日志显示你被抓得很勤,App 上的真实用户也可能永远看不到指向你的链接。

一句话记法:日志是”入口体检”,监测是”结果体检”,两个都要做,但别拿前者当后者的成绩单。 结果侧怎么测、测哪几个指标,见国内 AI 可见度监测指南;名词口径见GEO 术语表


六、顺带回答:llms.txt 到底要不要做

既然在讲”怎么让 AI 抓得舒服”,这个问题一定会被问到。数据很干脆:

  • Ahrefs 分析 13.7 万个站点97% 的 llms.txt 文件从未被 AI 爬虫读取过
  • 另一份统计里,5.15 亿次 AI bot 事件中只有 408 次请求真的落在 /llms.txt
  • 国内厂商(文心 / 豆包 / 通义 / DeepSeek)的官方文档至今对 llms.txt 零提及。

结论:做,但 10 分钟做完就走,别立项。 它成本极低、不会有负面影响,万一将来成了标准你已经在了;但把它当成 GEO 主线动作,是把力气花在了一个 0.0001% 命中率的文件上。真正值钱的三件事在下一节。


七、想被抓到,该做的七件事(不是防采集,是开门)

  1. 翻一遍 robots.txt 的历史遗留封禁。 2019–2024 年的中文教程教了整整一代站长去封 BytespiderYisouSpiderSogou web spider这些规则今天还躺在很多站的根目录里,而它们现在封的是 AI 入口。逐条重新决策,别继承。
  2. 翻 CDN / WAF 的 bot 管理规则。 比 robots.txt 更隐蔽——robots.txt 是”请你别来”,WAF 是”直接 403”。用第四节的状态码命令查,看到成片 403 就去后台找 AI bot 分类开关。
  3. 分开决策训练型和检索型。 如果你介意内容被拿去训练但想要引用,可以只放行 OAI-SearchBotPerplexityBotClaude-SearchBot 这类检索 bot,而对 GPTBotClaudeBotCCBot 收紧。这是海外那套 UA 分工唯一的实用价值。
  4. 国内走站长平台主动提交,别只等爬。 百度搜索资源平台、头条搜索站长平台、搜狗站长平台、神马站长平台——这四个才是国内”让 AI 抓到你”的正门。国内引擎的语料来自母体搜索,所以传统收录动作在 AI 时代反而重新值钱了。
  5. 别把关键事实藏在 JS 里。 多数爬虫不执行 JavaScript,前端渲染出来的价格、参数、FAQ 在它们眼里等于不存在。服务端渲染或静态化你最想被引用的那几页。
  6. 元宝这条链路不在你的服务器上。 它主要吃微信生态,日志里看不到就是正常的——对应的动作是公众号,不是 robots.txt。
  7. 每月复查一次。 UA 会变、IP 段会变、CDN 会推送新的默认 bot 规则。规则失效的时候不会报错,它只会安静地让你消失。

八、15 分钟自查清单

  • 跑第四节 ① 号命令,看过去 30 天到底有哪些 AI / 搜索 bot 来过,各多少次
  • 跑 ③ 号命令看状态码:有没有成片的 403 / 429(先修这个,其他都靠后
  • 打开 robots.txt,逐条确认有没有历史遗留的 Bytespider / YisouSpider / Sogou / GPTBot 封禁
  • 打开 CDN 控制台,确认 AI bot 管理是”拦截”还是”放行”
  • 跑 ② 号命令:它们抓的是不是你最想被引用的那几页
  • 抽 2–3 个 IP 做 rDNS 双向验证,确认不是伪装流量
  • 四个国内站长平台各确认一次收录状态
  • 最后一步,也是唯一能回答”到底有没有效”的一步:去豆包 / DeepSeek / 元宝 / 百度 AI 各问 3 个真实用户会问的问题,记下提没提你、引了谁

常见问题(FAQ)

服务器日志里能看到「豆包爬虫」「元宝爬虫」吗? 看不到,基本不存在这样一个 UA。国内 AI 助手大多复用母体搜索索引或买第三方搜索 API:豆包这边是 Bytespider(署名头条搜索站长平台),百度 AI 是 Baiduspider,元宝走微信搜一搜与搜狗生态,夸克/通义那侧是 YisouSpider,DeepSeek 则无自有爬虫。

日志里出现 Bytespider,是不是说明豆包会引用我? 不能这样推。可核实的只有 UA 署名头条搜索站长平台、IP 反查属字节抓取域;字节从未公开说明它与豆包答案语料的关系。它只能证明你进了候选池。

UA 里写着 GPTBot,就一定是 OpenAI 吗? 不一定,UA 可以随便伪造。验真只有两条路:比对厂商公布的机读 IP 文件(openai.com/gptbot.jsonperplexity.ai/perplexitybot.json),或做 rDNS + 正向 DNS 双向验证。放行名单一律以 IP 为准。

被 AI 爬虫抓过,等于被 AI 引用了吗? 不等于。Cloudflare Radar 2026 年 1–3 月数据:ClaudeBot 约抓 23,951 页才带回一次访问,GPTBot 约 1,276:1,Googlebot 只有约 5.2:1。日志证明”被抓走”,证明不了”被写进答案”。

要不要为了被 AI 抓到而做 llms.txt? 可以做,但别当项目做。97% 的 llms.txt 从未被读取,5.15 亿次 AI bot 事件里只有 408 次命中,国内厂商官方文档零提及。10 分钟做完就去修 robots.txt 和 WAF。

AI 爬虫把服务器抓崩了怎么办? 用限速(rate limit)而不是全封。对已验真的 bot 设合理的 QPS 上限、给静态资源上缓存,比一刀切 Disallow: / 好——后者省下的是带宽,赔进去的是入口。


参考来源

本文涉及的 UA 字符串、IP 归属与厂商文档均以各厂商官方页面的当前版本为准;爬虫标识与 IP 段会变更,建议每月复核一次。


日志能告诉你”门开着”,但打不开”AI 到底怎么说你”这一层。闻响 GeoEcho 同时监测你在国内(豆包 / DeepSeek / Kimi / 元宝 / 百度)和海外(ChatGPT / Perplexity / Gemini)引擎里的提及率、推荐率与引用来源——输入域名,30 秒出一份免费快照,不用约销售。

查看你自己的 AI 可见度

输入域名,30 秒内免费获取一份跨 ChatGPT、Perplexity、Gemini 和中国 AI 引擎的提及率快照。

免费查询 →

常见问题

服务器日志里能看到「豆包爬虫」「元宝爬虫」吗?

看不到,因为基本不存在这样一个 UA。国内 AI 助手大多不为「答问题」单独养一支爬虫,而是复用母体搜索的索引或买第三方搜索 API:豆包这边你会看到的是字节的 Bytespider(UA 里挂着 zhanzhang.toutiao.com,即头条搜索站长平台),元宝走的是微信搜一搜与搜狗生态,夸克/通义那侧是神马的 YisouSpider,百度 AI 用的是 Baiduspider。DeepSeek 则公开借助第三方搜索 API(如博查)联网,你的日志里根本不会出现「DeepSeekBot」。

日志里出现 Bytespider,是不是说明豆包会引用我?

不能这样推。可核实的只有两件事:这个 UA 指向头条搜索站长平台,反查 IP 的主机名属于 bytedance.com 的抓取域。字节从未公开说明头条搜索的抓取与豆包答案语料之间的具体关系,所以「Bytespider 来过」最多只能证明你进入了字节体系的候选池,证明不了你会出现在豆包的答案里。要确认后者,只能直接去问豆包并记录结果。

UA 里写着 GPTBot,就一定是 OpenAI 吗?

不一定,User-Agent 是请求方自己填的字符串,可以随便伪造,采集器伪装成 AI 爬虫以绕过限速是常见做法。要验真只有两条路:一是拿源 IP 去比对厂商公布的机读 IP 文件(OpenAI 在 openai.com/gptbot.json、searchbot.json、chatgpt-user.json 三个文件里公布,Perplexity 在 perplexity.ai/perplexitybot.json 公布);二是做反向 DNS + 正向 DNS 双向验证(Baiduspider 应解析到 *.baidu.com 或 *.baidu.jp)。放行名单一律以 IP 为准,不要以 UA 为准。

被 AI 爬虫抓过,等于被 AI 引用了吗?

完全不等于,这是这篇文章最重要的一条口径。按 Cloudflare Radar 2026 年 1–3 月的数据,ClaudeBot 平均抓约 23,951 个页面才带回一次访问,GPTBot 约 1,276:1,Perplexity 约 192.9:1,而 Googlebot 只有约 5.2:1。日志能证明的只有「我被抓走了」,证明不了「我被写进答案」。中间还隔着进候选池、被选中、被给出链接三道关。

要不要为了被 AI 抓到而做 llms.txt?

可以做,但别当项目做。Ahrefs 分析 13.7 万个站发现 97% 的 llms.txt 文件从未被 AI 爬虫读取过;另一份 5.15 亿次 AI bot 事件的统计里,只有 408 次请求真的落在 /llms.txt 上。国内厂商(文心、豆包、通义、DeepSeek)的官方文档至今没有提到过这个文件。它的成本是 10 分钟,收益接近于零但不为负——做完就去做真正有用的:robots.txt 别误封、CDN 别误拦、站长平台把内容提交进去。

GE
闻响 GeoEcho
GeoEcho 团队

闻响 GeoEcho 同时监测品牌在国内与海外 AI 引擎里的可见度。我们发布务实、中立的 AI 搜索可见度(GEO)指南。