一句话结论:AI 提及率没有通用及格线,追求一个「行业标准值」是这件事上最常见的误区。 提及率是「提到你的次数 ÷ 总采集次数」,分母有六个自由度(题数、采样次数、品牌词占比、引擎组合、取数的面、语言),任何一个变了,同一个品牌同一天就能算出差好几倍的数字——所以跨工具、跨行业、跨市场的提及率互不可比。英文侧确实有公开基准(中位品牌约 31%,见下文出处与口径),但那是英文引擎、英文提问、英文信源池的样本,不适用于豆包 / DeepSeek / 元宝。你唯一能用的基准有三条,全部来自你自己:自身起点基线、竞品同题对照(SOV)、以及你这套口径的最小可分辨变化。
为什么专门写这篇:截至 2026-08-07,中文搜索「AI 可见度 提及率 多少算好 / 行业基准 / 正常水平」,整页返回的几乎全是英文站。中文侧唯一在流通的基准是几句没有分母的区间值。这意味着今天一个中国市场人打开任何一家 GEO 工具的看板,看到「提及率 18%」,没有任何中文参照物告诉他这是好是坏——于是要么被销售的数字说服,要么自己拍一个目标。这篇不打算发明一个中文基准(我们没有可发布的中文样本,也不会编),而是做两件更耐用的事:说清楚为什么通用基准不存在,以及给你一套自己立基准的方法。
一、先把话说死:提及率是一个比例,不是一个分数
很多人把「提及率 18%」当成体检报告上的血糖值——好像存在一个客观的正常区间。它不是。它更像考试得分率:同一个学生,考卷不同,得分率就不同。
提及率的定义(严格定义见 GEO 术语表)是:
提及率 = 在一批固定问题里,AI 答案提到你品牌的次数 ÷ 总采集次数
分子相对客观(提没提到,人能判),问题全在分母。而这个分母有六个可以自由变动的旋钮:
| 旋钮 | 变化 | 对提及率的方向性影响 | 为什么 |
|---|---|---|---|
| 品牌词问题占比 | 提问集里含你品牌名的问题变多 | ↑ 大幅抬高 | 问句里有你的名字,AI 几乎必然提到你,这类题的提及率天然接近 100% |
| 题目难度结构 | 认知类(「什么是 XX」)占比高 | ↑ 抬高 | 认知类答案常泛泛罗列品牌;推荐类要进候选名单,难得多 |
| 引擎组合 | 增删一个引擎 | ↑↓ 都可能 | 各引擎的联网策略、召回源、罗列品牌的倾向差别极大 |
| 取数的面 | API / 网页 / App 换一个 | ↑↓ 都可能 | 同一个引擎三个面的答案和引用不是同一套 |
| 判定标准 | 简称、产品名、域名算不算「提到」 | ↑ 放宽即抬高 | 「只认品牌全名」和「提到域名也算」能差出一大截 |
| 是否去个性化 | 用登录态 / 同一会话连问 | ↑ 抬高 | 历史记忆和上下文污染会让 AI 更容易提到你 |
结论:任何一个提及率数字,脱离这六项就没有意义。有人告诉你「我们做到了 45%」,在追问这六项之前,你无法判断这是了不起还是自己给自己送分。
这也解释了一个常见困惑:为什么两家工具测同一个品牌,数字对不上。 不是谁算错了,是它们在测不同的考卷。
二、市面上现有的基准数字:逐条列出,标清出处和口径
既然基准不能直接抄,为什么还要列?因为知道别人是怎么定的,才知道自己该怎么定,也才有能力判断销售报给你的数字站不站得住。
以下全部为 2026-08-07 检索到的公开表述,逐条给出链接。我们未独立复核这些样本,列出的是他方口径。
2.1 英文侧:有数字,也有口径
| 来源(2026-08-07 检索) | 给出的基准 | 披露的口径 |
|---|---|---|
| MaxAEO《AI Visibility Benchmarks 2026》 | 中位品牌在相关的无品牌提问中约 31% 的答案会提到它;混合口径的前四分之一门槛约 58%;但行业分化极大——金融约 44% 即为前四分之一,出版需 72% | 8 个引擎(ChatGPT / Gemini / Perplexity / Claude / Copilot / Grok / Google AI Mode / AI Overviews);固定品类 prompt 面板每日跑;数百个被追踪品牌;滚动 90 天窗口 |
| Foglift《Industry-Wide Score Data》 | 跨行业中位 49/100;SaaS / 科技 63,建筑 / 地产 31 | 转引 Presenc AI 对 2,847 个品牌的基准 |
| Seenos《What’s a Good Score for Your Industry?》 | 各行业中位分布在 48–62,前四分之一门槛 73–84(百分制) | 行业切分的综合可见度评分,非单一提及率 |
| Data-Mania《AI Search Visibility Benchmarks 2026》 | 提及率与引用率必须分开报;据其转引,Perplexity / Copilot 超 77% 的回答带外链,而 ChatGPT 约 31%;品类领导者在其最强引擎上的引用份额通常 25–45%(Attrifast 口径) | B2B SaaS 视角;引用他方数据,我们未独立复核 |
从这张表里该带走的三件事,比数字本身值钱:
- 最好的英文基准也在强调「按你自己的行业比,别比混合平均」。 MaxAEO 自己就点明:31% 对医疗品牌是优秀,对出版商是平庸;受监管行业(金融、医疗)存在结构性天花板——AI 在钱和健康的问题上更保守、更少直接点名品牌。行业不同,同一个数字的含义相反。
- 它们几乎都披露了口径。 引擎清单、prompt 面板、时间窗、样本量——这是「基准」和「一句断言」的分界线。你收到的任何中文基准,都该用同样的标准去要求它。
- 提及率和引用率不是一回事,而且差距取决于引擎。 一个引擎在 77% 的回答里给外链、另一个只有 31%,那么「引用率低」很可能只是引擎行为差异,不是你的内容不行。跨引擎横比引用率之前,先看这个引擎给不给链接。
2.2 中文侧:有区间,没有分母
中文能搜到的基准表述,主要是两组:
- 一组是「低于 10% 偏低 / 10–30% 良好 / 30% 以上优秀」这类三档区间(见白杨SEO 的知乎长文,2026-08-07 检索)。
- 一组是分阶段目标:以 20–30 个目标客户真实会问的问题为分母,起步阶段 0–10% 属正常,持续运营三个月应达 15–25%,半年后稳定在 30–50% 为健康(见搜狐《GEO 效果评估怎么做?工厂实体衡量 AI 优化效果的 6 个核心指标》,2026-08-07 检索)。
这两组都指向同一个方向(有个位数是起步、30% 以上是好状态),方向上和英文侧的量级也对得上。但作为基准,它们缺三样东西:
| 缺什么 | 为什么致命 |
|---|---|
| 分母的构成 | 20–30 条题里含几条品牌词问题?只要塞进三成品牌词题,提及率就能凭空抬高一大截,而这完全由写题的人控制 |
| 采样次数 | 每题跑 1 次和跑 3 次是两个东西。20 题 × 1 次 = 20 次采集,95% 误差范围约 ±20 个百分点——这个规模下报「23%」是没有意义的 |
| 引擎与面 | 6 个引擎的平均,还是只测了 DeepSeek 网页版?中国用户大量在 App 里提问,而 App 面的结果和 API 面往往不同 |
顺带说明一点公平的话:这些中文稿子给的方法论碎片是有价值的——比如强调「每题在各平台重复提问至少 3–5 次、每周采样一次」,以及把可见度拆成提及率 / 推荐率 / 引用率三层再加权(有一版权重是提及 30%、推荐 40%、引用 30%,见阿里云开发者社区的方法论文,2026-08-07 检索)。方法是对的,缺的是样本。 我们的判断是:在中文侧有人公开一套带完整口径披露的样本之前,任何中文「行业基准值」都只能当作方向感,不能当作达标线。
我们自己也遵守这条:GeoEcho 目前不发布中文行业基准数字,因为我们没有可公开、可复核的样本。什么时候有了,会连同提问集构成、引擎与面、采样次数、品牌数一起发。
三、为什么英文基准搬不到中文引擎上:五条硬差异
即使你完全接受 31% 这个数字,把它设成中国市场的 KPI 依然会错。五条原因:
- 引擎栈完全不同。 英文基准的样本是 ChatGPT / Gemini / Perplexity / Claude / Copilot 等;你的中国用户在用豆包、DeepSeek、Kimi、元宝、通义、百度 AI、夸克。两批引擎的召回策略、联网默认值、罗列品牌的倾向都不一样,不存在换算关系。
- 信源池不同。 海外引擎大量调用 Reddit、英文维基、G2、Trustpilot、YouTube;中文引擎调用的是微信公众号、知乎、小红书、百度百科、各家自有生态(差异详见出海品牌的 GEO:国内那套打法为什么套不到 ChatGPT)。信源池不同,被提及的难度就不同。
- 多了一个「面」的维度。 海外基准基本在网页 / API 面上取数;中国的实际提问大量发生在 App 内,而 App 面拿不到精确 URL、引用呈现方式也不同——海外工具在中国的盲区,主要就是漏掉 App 那一层。
- 联网行为不同。 部分国内引擎默认不联网或需手动开启(DeepSeek 要手动开联网才给来源)。不联网时答案只凭模型内部知识生成,新品牌几乎不可能被提到——这会系统性压低整体数字,和你优化得好不好无关。
- 语言即分母。 一条中文问题和它的英文译版是两条不同的题,检索到的内容完全不同,不能算作同一条做跨市场对比。双栈品牌应该出两张表,而不是把两边的提及率平均成一个数。
四、那基准到底该怎么定:三条你自己能立的基准
放弃「行业标准值」之后,你需要的其实是三个更实用的参照物。
基准一:自身起点基线(回答「有没有变好」)
这是最基础也最容易做对的一条,规则只有两句:口径先冻结,再取零点。
- 定稿提问集并冻结至少 6 轮(每两周一轮约 3 个月)。提问集就是你的分母,中途改题等于换考卷,前后数据不可比。怎么设计见GEO 监测的提问集怎么设计。
- 把品牌词问题单独一个分母,永远不要和无品牌问题合并算率。「无品牌提及率」测的才是你的真实处境。
- 第一轮的结果就是你的零点。 不要跟任何外部数字比,只跟这个零点比。
- 在趋势图上标注所有口径变更(换引擎、加题、换面),半年后没人记得当时为什么涨。
基准二:你这套口径的最小可分辨变化(回答「这个涨跌是不是真的」)
这是绝大多数 GEO 报告站不住脚的地方,但它可以算出来。提及率是比例,抽样误差只取决于 n = 题数 × 每题采样次数:
| 每轮每引擎采集次数 n | 对应配置举例 | 95% 误差范围 | 两轮之间最小可分辨变化 |
|---|---|---|---|
| 20 | 20 题 × 1 次 | ±20.5 pp | 29 pp |
| 60 | 20 题 × 3 次 | ±11.6 pp | 16 pp |
| 150 | 50 题 × 3 次 | ±7.3 pp | 10 pp |
| 300 | 100 题 × 3 次 | ±5.2 pp | 7 pp |
| 650 | 217 题 × 3 次 | ±3.5 pp | 5 pp |
(pp = 百分点。基于二项分布标准误估算,取 p=0.3;p 越接近 50% 误差越大。这是理想上界——同题多次采样彼此相关、并非独立样本,真实误差比表里更大。)
怎么用:先查出你当前配置对应的那一行,把那个「最小可分辨变化」写进报告的脚注。低于这个数的涨跌,一律不解读。 这一条比任何行业基准都更能提升你数据的可信度——也是你审服务商月报时最好用的一把尺子。
基准三:竞品同题对照 / 声量份额(回答「我们排第几」)
这是唯一真正可比的横向基准,因为分母对所有人都一样。
做法:在同一批问题、同一轮采集、同一个引擎面上,同时统计你和 3–5 个主要竞品各自被提到的次数,算相对占比。
| 指标 | 回答什么问题 | 受口径影响 |
|---|---|---|
| 绝对提及率 | 「我们在这套口径下是什么水平」 | 大(六个旋钮全影响) |
| 声量份额(SOV) | 「在同一道题上我们排第几」 | 小(分母对所有人一致) |
| 推荐位次 | 「被列在第几个」 | 中 |
| 被引来源集中度 | 「AI 是从哪几个域名认识我们的」 | 小 |
两条实践建议:
- SOV 更适合汇报,绝对提及率更适合内部跟踪。 老板问「我们做得怎么样」,答「在这 50 道品类题里,我们出现在 22% 的答案中,主要竞品 A 是 41%、B 是 18%」,比答「我们 22%,行业基准 30%」诚实得多,也具体得多。
- 竞品名单要冻结。 中途把表现好的竞品换掉,SOV 会自动变好看——这和换考卷是同一类操作。
五、拿到一个提及率数字,先问这七个问题
无论数字来自工具看板、服务商月报,还是你自己的脚本,按这张清单过一遍。任何一项答不上来,这个数字就不能进汇报材料。
| # | 追问 | 为什么问 |
|---|---|---|
| 1 | 分母是多少条题、每题跑几次? | 决定了误差范围和最小可分辨变化 |
| 2 | 其中含品牌名的问题占多少?有没有单独算? | 混入品牌词题会系统性抬高数字,且完全可控 |
| 3 | 哪几个引擎?各引擎是分开报还是合并平均? | 合并平均会让一个引擎的暴涨掩盖另一个的崩塌 |
| 4 | 取数在哪个面(API / 网页 / App)? | 三个面结果不同;上周网页、这周 App,涨跌全是噪声 |
| 5 | 「提到」怎么判定?简称、产品名、域名算不算? | 判定标准放宽,数字自动变好看 |
| 6 | 是不是去个性化采集(无痕 / 未登录 / 每次新开对话)? | 登录态和上下文污染会把数字抬高 |
| 7 | 和上一轮相比,以上六项有没有任何变化? | 只要变了一项,两轮就不可比,趋势线从这里断掉 |
这套追问对**任何一家工具(包括我们)**都成立。选型时怎么系统性地验各家宣称,见GEO 工具排行榜是怎么来的:「99.5% 准确率」这类宣称你自己怎么验。
六、什么时候低数字是正常的,什么时候高数字是虚的
低不一定是坏(四种情况)
- 受监管品类(金融、医疗、法律)——AI 在钱和健康问题上更保守、更少点名具体品牌,存在结构性天花板。英文侧的基准也承认这一点:金融行业约 44% 就已是前四分之一。
- 引擎默认不联网——答案只凭模型内部知识生成,成立不久的品牌几乎不可能出现。先确认联网开关状态再解读。
- 提问集偏难——你的题全是「有哪些做 XX 的公司比较靠谱」这类要进候选名单的推荐题,本来就比认知题难得多。这是好事,说明你在测真实战场。
- 品类本身极窄——AI 在小众品类里常常只列两三家,或者干脆改答方法论。这时该看的是被引来源,不是百分比。
高不一定是好(五个红旗)
- 🚩 提问集里品牌词问题占比高。 数字漂亮,和生意无关。
- 🚩 只报一个总提及率,不分类别。 信任类 100%、推荐类 0%,和五类都在 40%,是完全不同的两种处境,合并后都看不见。
- 🚩 采集在登录态、同一会话里连问。 上下文污染,系统性虚高。
- 🚩 提及率高但被引来源高度集中在少数几个软文站。 这是脆弱信号——信源集中意味着一次权重调整就可能把你打回原形。
- 🚩 月报数字漂亮,但提问集这个月改过。 换考卷带来的偏移会被当成优化成果。如果是外包,把提问集写进合同附件、变更走书面确认,是最低成本的一道保险。
七、一张可以直接抄的「基准登记表」
在你第一次报出任何百分比之前,先把下面这张表填满,贴在每份报告的第一页。填不满的项,就是你现在还不能报数的原因。
| 项 | 你的值 |
|---|---|
| 提问集版本号 / 冻结日期 | |
| 题数(无品牌 / 含品牌,分开填) | |
| 每题每轮采样次数 | |
| 引擎清单 | |
| 每个引擎的取数面(API / 网页 / App) | |
| 联网开关状态 | |
| 「提到」的判定标准 | |
| 去个性化方式(无痕 / 未登录 / 新开对话) | |
| 每轮每引擎总采集次数 n | |
| 对应的最小可分辨变化(查第四节表) | |
| 零点日期与零点值(分类别) | |
| 对照竞品名单(冻结) |
填完之后你会发现一件事:「提及率 18%」这句话本身信息量极低,而这张表连同 18% 一起,才构成一个可被复核、也可被追踪的结论。
常见问题(FAQ)
AI 提及率多少算好?有没有通用及格线? 没有。分母有六个自由度(题数、采样次数、品牌词占比、引擎组合、取数的面、语言),任何一个变了,同一个品牌同一天能算出差好几倍的数字。有意义的基准只有三条,全部来自你自己:起点基线、竞品同题对照、最小可分辨变化。
英文侧的基准数字能参考吗? 能当量级参考,不能当目标。MaxAEO 称中位品牌在无品牌提问中约 31% 被提及、混合口径前四分之一约 58%(2026-08-07 检索),但样本是八个英文引擎、英文提问、英文信源池,里面没有豆包、元宝、DeepSeek。
中文流传的「10–30% 良好、30% 以上优秀」靠谱吗? 方向上和英文侧量级对得上,但都没披露分母:多少题、跑几次、哪些引擎、哪个面、含不含品牌词题。缺这些,同一个「30%」可能来自完全不同的两套测量。
第一次跑出来的数字怎么用? 当作零点,并且分类别看(推荐类 / 对比类 / 场景类分开)。第一次跑最值钱的产出不是那个百分比,而是两份清单:你完全缺席的问题,以及所有被引来源的域名。
涨了 5 个百分点算真涨吗? 看你每轮的总采集次数。50 题 × 3 次 = 150 次的配置下,最小可分辨变化约 10 个百分点,5 个百分点和噪音区分不开;要稳定分辨 5 个百分点需要约 650 次采集。
跟竞品比是不是比跟行业基准比更有用? 是。同题、同轮、同面下的声量份额是唯一真正可比的横向基准,因为分母对所有人一致,天然免疫口径差异。
不同工具的提及率为什么对不上? 六个变量至少差一个,它们在测不同的东西。选型时要求每家披露这六项,再在同一批 prompt 上各跑一次、手动抽样复核。
与其找一个基准,不如把口径钉死
「提及率多少算好」这个问题之所以在中文侧没有答案,不完全是因为没人做样本——更根本的原因是,在口径没有统一之前,这个问题在数学上就没有唯一解。
所以更值得投入的不是找基准,是做三件事:把提问集和判定标准钉死并写进文档;算出你这套配置的最小可分辨变化;同一批题上把竞品一起测了。 做完这三件事,你会拥有一个别人给不了你的东西——一条跨周可比、经得起追问的曲线。到那时,18% 是高是低已经不重要了,重要的是它在往哪走、你为什么知道那不是噪音。
需要说明的是,这三件事有一个共同前提:同一套问题、在同一批引擎和同一个面上、按固定周期、一字不改地重跑。这恰恰是手工做不到的部分——50 题 × 3 次 × 6 引擎,每轮就是 900 次新开对话,还要逐条记录引用来源。自己写脚本还是买工具,这笔账我们单独算过一次,见自己写脚本监测 AI 提及,还是买工具。
闻响 GeoEcho 支持导入你自己的提问集,在国内(豆包 / DeepSeek / Kimi / 元宝 / 通义 / 百度 AI)与海外(ChatGPT / Perplexity / Gemini)引擎上按固定周期重跑,分引擎、分面记录提及率、推荐率与被引来源,并把竞品放在同一批题上一起算 SOV。还没有提问集,也可以先输入域名跑一次免费快照,把零点先立起来。完整的跨引擎执行流程见如何监测品牌在国内 AI 搜索里的可见度。
常见问题
AI 提及率多少算好?有没有一个通用的及格线?
没有,而且追求一个通用及格线本身就是错的方向。提及率是「答案里提到你的次数 ÷ 总采集次数」,这个分母有六个自由度——题数、每题采样次数、品牌词占比、引擎组合、取数的面(API / 网页 / App)、语言。任何一个变量变了,同一个品牌在同一天能算出差好几倍的数字。所以跨工具、跨行业、跨市场的提及率数字互相之间不可比,别人的「30% 算优秀」搬到你的口径上没有意义。有意义的基准只有三条,全部来自你自己:自身起点基线、竞品同题对照、以及你这套口径的最小可分辨变化。
英文侧公开的那些基准数字(比如中位 31%)能参考吗?
能当作量级参考,不能当作目标。截至 2026-08-07 检索,英文侧确实有公开基准:MaxAEO 称其跨品牌汇总里,中位品牌在相关的无品牌提问中约 31% 的答案会提到它,混合口径的前四分之一门槛约 58%,但行业差异极大——金融约 44% 就已进前四分之一,出版则要 72%。这些数字的口径是八个英文引擎(ChatGPT / Gemini / Perplexity / Claude / Copilot / Grok / Google AI Mode / AI Overviews)、固定品类提问面板、滚动 90 天。它测的是英文语境下的英文引擎,样本里没有豆包、元宝、DeepSeek,也没有中文提问和中文信源池,因此不能作为中国市场的达标线。
中文侧流传的「低于 10% 偏低、10–30% 良好、30% 以上优秀」靠谱吗?
这类区间在中文搜索里确实反复出现,但共同的问题是没有披露分母:多少条问题、每条跑几次、哪些引擎、哪个面、含不含品牌词问题、样本里有多少个品牌。缺了这些,同一个「30%」可能来自 20 条题跑 1 次,也可能来自 200 条题跑 3 次跨 6 个引擎,两者不是同一个东西。更实际的问题是:如果提问集里塞了三成品牌词问题(问句里带你的名字,AI 几乎必然提到你),提及率会被系统性抬高,而这个抬高完全可控——所以在追问分母之前,任何区间都不该被当成标准。
那我第一次跑出来的数字该怎么解读?
第一次跑出来的数字只有一个用途:当作你自己的零点。正确的读法是把它拆开看——推荐类问题的提及率、对比类的提及率、场景类的提及率分别是多少(合并成一个总数会掩盖真实处境),以及你完全缺席的是哪些问题、竞品出现在哪些问题里、答案引用了哪些来源域名。第一次跑不要报百分比给老板,除非你的采集量够大:50 题 × 3 次 = 150 次采集,误差范围约 ±7 个百分点,只够分辨 10 个百分点以上的变化。
跨周对比时,涨了 5 个百分点算不算真的涨了?
取决于你每轮的总采集次数。提及率是比例,比例的抽样误差只看 n = 题数 × 每题采样次数。在 p≈30% 的量级上,150 次采集的最小可分辨变化约 10 个百分点,300 次约 7 个,要稳定分辨 5 个百分点需要约 650 次。也就是说,50 题 × 3 次的配置下,「这个月从 30% 涨到 35%」在统计上和噪音区分不开。汇报之前先算一次你自己的这个阈值,比争论涨跌原因有用得多。
跟竞品比提及率,是不是比跟行业基准比更有用?
是,这是唯一真正可比的横向基准,前提是同题同轮同面。做法:在同一批问题、同一轮采集、同一个引擎面上,同时统计你和 3–5 个主要竞品各自被提到的次数,算相对占比(声量份额 SOV)。它天然免疫口径差异——分母对所有人都一样,谁的提问集设计得松、谁的采样次数多,都不影响这个相对值。绝对提及率回答「我们在这套口径下的水平」,SOV 回答「在同一道题上我们排第几」,后者才是能拿去开会的数字。
为什么不同工具算出来的提及率对不上?
六个变量至少差一个:提问集不同、每题采样次数不同、引擎组合不同、取数的面不同(同一个引擎的 API、网页、App 给的答案和引用来源不是同一套)、判定标准不同(只算品牌全名,还是简称、产品名、域名也算)、以及是否去个性化(登录态和历史会话会把结果带高)。这不是谁算错了,是它们在测不同的东西。选工具时该做的不是比谁的数字好看,而是要求每一家披露这六项,然后在同一批 prompt 上各跑一次,你自己手动抽样复核。