一句话结论:一份能用的 GEO 提问集,要同时满足四件事——七成以上是不含你品牌名的问题(品类、对比、场景),按推荐 / 对比 / 场景 / 信任 / 认知五类配比,每条每轮至少跑 3 次新开对话,一旦定稿就冻结至少 6 轮。条数由你要分辨多大的变化决定:50 条 × 3 次只能看出 10 个百分点以上的波动,要看出 5 个百分点,需要 200 条以上。
为什么专门写这篇:搜「GEO 监测 提问集 / prompt 词库 / 问题清单怎么设计」,返回的几乎全是工具榜单和产品页,所有人都在写「支持批量导入上百条 prompt」,没有一篇告诉你该导入哪些、导多少条、每条跑几次才算数。而这恰恰是整条链路上最早、也最不可逆的一步:提问集配错了,后面所有引擎、所有指标、所有趋势图都是在给噪音画线。
如果你还没做过任何一次自查,先看怎么免费自查品牌在 AI 里有没有被提到——那篇给的是零成本手动跑一轮的最小流程;这一篇是它的进阶版,讲的是怎么把那份临时清单变成能长期跑、能被人复核的提问集。
一、先统一叫法:提问集 = 你所有指标的分母
同一件东西在中文里有一堆叫法:提问集、prompt 集、问题清单、词库、prompt matrix、监测问题库。指的都是同一样东西:
一批固定的、模拟真实用户向 AI 提问的完整句子;每一轮监测都用同一批句子、在同一批引擎上、按同样的次数跑一遍。
关键在「固定」两个字。所有 AI 可见度指标——提及率、推荐率、声量份额——都是分子除以分母的比例,而提问集就是那个分母(各指标的严格定义见 GEO 术语表)。
这带来一个很多人没意识到的后果:提问集的质量上限,就是整套监测的质量上限。工具能帮你把 300 条问题跑到 6 个引擎上,但它不会告诉你这 300 条问的是不是真实用户会问的东西。分母错了,跑得再勤也只是把错误结论算得更精确。
二、该问哪些:五类场景 × 三级意图
不要按关键词表来配,那是 SEO 的思路。AI 提问集要按用户处在决策的哪一步来配。
| 类别 | 意图层级 | 用户在干什么 | 例句模板 | 建议占比(成长期 / 成熟期) |
|---|---|---|---|---|
| 推荐类 | P0 成交 | 直接要一份候选名单 | 「有哪些做 XX 的公司/工具比较靠谱?」「XX 推荐几个」 | 35% / 30% |
| 对比类 | P1 对比 | 已有候选,在里面选 | 「A 和 B 哪个更适合 C?」「XX 的替代方案有哪些?」 | 25% / 30% |
| 场景/约束类 | P0–P1 | 带着真实条件找方案 | 「预算有限的小团队做 XX 该怎么选?」「跨境电商做 XX 用什么?」 | 20% / 20% |
| 信任/尽调类 | P1 | 已经知道你,在验你 | 「XX 靠谱吗?」「XX 有什么缺点?」「XX 和 YY 哪个坑少?」 | 10% / 10% |
| 认知/教育类 | P2 认知 | 还不知道自己要买什么 | 「什么是 XX?」「XX 该怎么做?」 | 10% / 10% |
三条配比原则:
- 无品牌问题至少占 70%。 推荐类、场景类、认知类天然不含品牌名,对比类里也应该有一半是「XX 的替代方案有哪些」这种开放式问法。含品牌名的问题(信任类 + 一部分对比类)总量控制在 30% 以内。
- 新品牌加重推荐类和认知类,因为你要先解决「AI 根本没想起你」;成熟品牌加重对比类,因为你的战场已经是「在候选名单里排第几、被谁挤掉」。
- 五类各自独立算率,不要只报一个总提及率。 一个品牌在信任类问题上提及率 100%、在推荐类上 0%,和五类都在 40% 左右,是完全不同的两种处境,合并成一个数字就都看不见了。
品牌词问题必须单开一个分母
这是提问集设计里最常见、也最致命的一个错误:把「XX 是做什么的」这类问题和「有哪些做 XX 的工具」放在同一个分母里算提及率。
问题里带了你的品牌名,AI 几乎必然会提到你——这类问题的提及率天然接近 100%。混进总数,等于给自己的 KPI 掺水:提问集里品牌词占比越高,你的提及率看起来越好,而这个「好」和生意没有任何关系。
正确做法是至少拆成两个分母:
- 无品牌提及率 = 不含你品牌名的问题里,答案提到你的比例 ← 这是真实处境
- 品牌词准确率 = 含你品牌名的问题里,AI 描述正确(业务范围、价格、是否还在运营)的比例 ← 这测的是另一件事
信任 / 负面类问题:指标方向是反的
「XX 有什么缺点」「XX 是不是跑路了」「XX 和 YY 哪个坑多」——这类问题必须放进提问集,但记录方式和其他类完全不同:
| 记什么 | 为什么 |
|---|---|
| ❌ 提及率 | 你的名字就在问句里,永远 100%,零信息量 |
| ✅ 情感极性 | 正面 / 中性 / 负面 / 明确劝退——这才是这类问题的输出 |
| ✅ 被引用的负面来源 URL | 最值钱的一列:知道 AI 从哪条页面读到的负面,负面才从「感觉不好」变成可处置对象 |
| ✅ 陈述是否过时 | 三年前的旧新闻被当成现状复述,是国内品牌最常见的一类损伤 |
拿到负面来源 URL 之后怎么分引擎处置,见AI 把我公司信息说错了怎么改。
三、问题从哪来:五个真实来源,别拍脑袋编
坐在会议室里编出来的问题,通常是市场部的语言,不是用户的语言。按这五个来源采集,质量依次递减:
- 销售和客服真实被问过的话(质量最高)。翻聊天记录、工单、售前答疑,把原句抄下来——这是唯一能保证「真人真的这么问」的来源。
- 各引擎自己给的追问建议。在豆包、DeepSeek 里问一个品类问题,答案底部往往会推荐相关追问,那些就是引擎认为的高频后续问题。
- 搜索下拉与相关搜索(百度、微信搜一搜、知乎、小红书)。注意:这些是关键词,必须改写成完整句子才能进提问集。
- 竞品的对比页和「XX 替代」词。竞品花钱买的对比词,说明这些对比真的有人问。
- 让 AI 反推:直接问「用户想选 XX 类产品时,通常会问哪些问题」,然后人工筛。这条最省事也最危险——AI 生成的问题高度同质化、句式雷同、还爱写成不像真人说话的书面语,必须人工去重和改写,占比别超过三成。
写法规范(六条硬性检查)
- ✅ 写成完整句子,不是关键词。 用户对 AI 打的是「预算 5 万做跨境独立站的 SEO 该找谁」,不是「跨境 SEO 服务商 排名」。
- ✅ 一条只考一件事。 「A 和 B 哪个好,另外这个行业现在怎么样」会让答案发散,判定也没法做。
- ✅ 不要写引导性问句。 「最好的 XX 工具是不是 GeoEcho?」这种问法是在给自己送分。
- ✅ 长度像真人一次输入(大致 10–40 字)。写成 200 字的需求 brief,测的就不是普通用户的场景了。
- ✅ 中英各自独立成条。 一条中文问题和它的英文译版检索到的信源池完全不同,不能算作同一条做跨市场对比(双栈信源的差异见出海品牌的 GEO:国内那套打法为什么套不到 ChatGPT)。
- ✅ 每条带元数据落库:
ID / 类别 / 意图层 / 语言 / 是否含品牌名 / 进入版本号。没有这几列,后面的分层统计和版本治理全做不了。
四、写多少条:用「你要分辨多大的变化」反推
这是全网都在回避、但其实可以算出来的一个问题。
提及率是一个比例。比例的抽样误差只取决于一个数:该引擎该轮的总采集次数 n = 题数 × 每题采样次数。按二项分布估算,标准误 = √(p(1−p)/n)。
下表用 p = 30%(一个常见的提及率量级)计算。「最小可分辨变化」指的是:两轮之间的差值要大于这个数,才能说「不是随机波动」:
| 每轮每引擎采集次数 n | 对应配置举例 | 提及率的 95% 误差范围 | 两轮之间最小可分辨变化 |
|---|---|---|---|
| 30 | 10 题 × 3 次 | ±16.4 pp | 23 pp |
| 60 | 20 题 × 3 次 | ±11.6 pp | 16 pp |
| 150 | 50 题 × 3 次 | ±7.3 pp | 10 pp |
| 300 | 100 题 × 3 次 | ±5.2 pp | 7 pp |
| 650 | 217 题 × 3 次 | ±3.5 pp | 5 pp |
| 1500 | 500 题 × 3 次 | ±2.3 pp | 3 pp |
(pp = 百分点。计算基于二项分布标准误,p=0.3;p 越接近 50%,误差越大。这是理想上界——同一条问题的多次采样彼此相关,并非独立样本,所以真实误差比表里更大。)
这张表能直接读出三个结论:
- 行业里流传的「50 问 × 3 次」,实际分辨率是 10 个百分点。 这个配置能告诉你「我们大概在 30% 这个量级」,但你报「这个月从 30% 涨到 35%」时,那 5 个百分点在统计上和噪音区分不开。
- 想诚实地汇报 5 个百分点的变化,提问集要 200 条以上。 这是很多「优化前后对比」报告站不住脚的根本原因——不是优化没效果,是尺子刻度不够细。
- 10–20 条的提问集,只能用来定性。 误差 ±16 个百分点,任何百分比都不该出现在报告里,这个规模只适合回答「我们在这个品类里是完全隐形,还是偶尔出现」。
按阶段的实用建议
| 你的阶段 | 提问集规模 | 采样 | 该报什么 |
|---|---|---|---|
| 第一次摸底 | 20–30 条 | ×3 | 只报方向和缺口清单,不报百分比 |
| 常规运营 | 50–80 条 | ×3 | 报量级和被引来源变化,涨跌小于 10 pp 不解读 |
| 要汇报涨跌 / 做优化前后对比 | 150–250 条 | ×3 | 可以报 5 pp 级别的变化 |
| 多品类 / 多区域大盘 | 300+ 条 | ×3 | 需要分品类子集各自达标,别指望总数掩护 |
作为对照:公开的方法论文章里也能看到类似的分层建议,比如腾讯云开发者社区的一篇 AI 可见性监测体系文提出周度用 20–30 条核心商业意图 prompt、月度用 100–200 条覆盖决策全路径、季度做 500–2000 条长尾扫描。量级和上表基本对得上——区别在于,上表告诉你每一档换来的是多大的分辨率,而不只是一个建议数字。
五、每条跑几次:3 次是下限,但别把预算都花在这里
为什么 1 次不行:AI 的回答是每次生成的。同一条问题问三遍,很可能三种措辞,甚至有的提到你、有的不提。跑 1 次的结果无法区分**「这条我们确实没被提及」和「这一次恰好没被提及」**——而这两件事对应的行动完全相反。火山引擎社区一篇AI 排名监控实战文甚至称同一品牌在一天内不同时段的被提及概率波动可超过 30%(他方口径,我们未独立复核,但方向与我们日常观察一致)。
为什么不必堆到很高:同一条问题的多次采样是相关样本——它们共享同一个问法、同一个检索意图,重复跑只能压掉「这一次的随机性」,压不掉「这条问题选得偏」的风险。
所以在同样的采集预算下:
先把题数加到 40–60 条、每题 3 次;再要提升精度,加题比加次数更划算。
一个具体的取舍:预算 300 次采集,100 题 × 3 次 比 50 题 × 6 次 更好——前者覆盖的真实提问面翻倍,而后者只是把同样 50 个问题量得更准。
例外情况,这几种时候该把次数提到 5–7 次:
- 推荐类、对比类的核心几条(直接关联成交的那些问题)——西品东来的一篇 GEO 报告指标文建议推荐率类指标每个 prompt 至少 5–7 次采样,因为推荐位涉及主观判定,波动更大。
- 要做优化前后对比的那一小批问题——这时你关心的是单条的变化,不是大盘。
- 答案明显不稳定的问题(几次跑下来结论互相矛盾)——不稳定本身就是一个值得单独记录的信号。
采样的操作纪律(这几条错了,跑再多次也白跑):
- 每次新开对话。 同一会话里连问会造成上下文污染,你上一句提过品牌名,下一句就会被「记住」,提及率被系统性抬高。
- 去个性化。 尽量用未登录 / 无痕状态,登录态的历史记忆会让结果偏向你自己。
- 固定联网开关并记录。 尤其 DeepSeek 必须手动开联网才给来源,混着测等于把两组数据搅在一起。
- 固定「面」。 豆包的 API、网页、App 三个面的引用不是同一套,上周测网页、这周测 App,涨跌全是噪声。
六、算清楚成本:提问集是采集量的主轴
提问集条数不是一个孤立的数字,它会被后面几项乘起来:
每轮采集次数 = 题数 × 采样次数 × 引擎数 ×(各引擎要测的面 / 模式数)
| 配置 | 每轮采集次数 | 每两周一轮的年采集量 |
|---|---|---|
| 30 题 × 3 次 × 3 引擎 | 270 | 约 7,000 |
| 50 题 × 3 次 × 6 引擎 | 900 | 约 23,400 |
| 100 题 × 3 次 × 6 引擎 | 1,800 | 约 46,800 |
| 200 题 × 3 次 × 6 引擎 × 2 语言 | 7,200 | 约 187,000 |
两个直接后果:
- 手动做不了。 就算只按第二行,每两周 900 次新开对话、逐条记录来源,已经不是人力能持续的事——这也是手动自查的天花板所在。
- 选工具时,「多少钱」要换算成「买到几次采样」。 不同工具报价口径差别极大,有的按 prompt 数、有的按引擎数、有的按查询次数计费,直接比月费没有意义。公开定价的横向换算见GEO 监测工具多少钱:这个价买到几次采样。
七、版本治理:改题 = 换考卷
提问集最容易在运营半年后悄悄失效——不是因为设计得差,而是因为被随手改了。
四条规则:
- 冻结期至少 6 轮。 每两周一轮的话,就是约 3 个月不动。这期间只允许修正错别字,不允许改语义。
- 增补开新版,并且双跑桥接。 要加问题就开 v2;v1 必须继续并行跑至少 3 轮,这样 v1 的趋势线不断档,同时你还能看到 v1 和 v2 在同一时间点的差值——那个差值就是「换考卷」本身带来的偏移量。
- 删题只允许删「已失效」的(品类消失、产品下线、公司改名),并且要在趋势图上标注删除时间点和影响的分母大小。
- 每次版本变更在趋势图上打一条竖线。 半年后没人记得当初为什么涨了——图上那条线是唯一的答案。
一个反面模式,值得单独点名:如果你外包给了服务商,而对方每个月悄悄调整提问集,那么报告上的「提升」很可能只是换了容易的题。要求把提问集作为附件写进合同、变更走书面确认,是甲方最低成本的一道保险。
八、九个会毁掉提问集的做法
- 🚩 只问品牌词。提及率天然接近满分,用它做 KPI 等于自动达标。
- 🚩 品牌词和无品牌词混在一个分母里。整体指标被系统性抬高,且抬高幅度取决于你放了多少品牌词——完全可操纵。
- 🚩 写成关键词而不是句子。「XX 品牌 排名」不是任何真人会对 AI 打的话。
- 🚩 每题只跑 1 次。那是抽样,不是指标。
- 🚩 同一会话里连着问。上下文污染,提及率虚高。
- 🚩 中途改题却不留版本。前后不可比,趋势图从这一刻起失去意义。
- 🚩 把负面类问题和推荐类合并算提及率。指标方向相反,混在一起两边都读不出来。
- 🚩 中英文互译当同一条。信源池不同,跨市场对比无效。
- 🚩 全靠 AI 生成问题、不做人工筛。同质化严重、句式雷同,测出来的是「AI 觉得用户会问什么」,不是用户真的问什么。
九、一份可直接抄的 30 条起步模板
把 XX 换成你的品类词、YY 换成主要竞品、ZZ 换成典型场景。这 30 条按上文配比排好,第一次摸底直接用它,每条跑 3 次:
推荐类(P0,10 条 · 全部无品牌)
- 有哪些做 XX 的公司比较靠谱?
- XX 有哪些主流的解决方案?
- 国内做 XX 的工具推荐几个
- 做 XX 一般找什么样的服务商?
- XX 领域比较专业的品牌有哪些?
- 想做 XX,市面上有哪些选择?
- 有没有好用的 XX 工具推荐
- XX 这块国内谁做得比较好?
- 企业采购 XX 通常会选哪几家?
- 2026 年做 XX 有哪些新选择?
对比类(P1,8 条 · 一半无品牌) 11. XX 的替代方案有哪些? 12. 做 XX 的几家主流供应商,各自优劣是什么? 13. 选 XX 服务商主要看哪些指标,怎么横向比? 14. YY 和同类产品比有什么区别? 15. 国内的 XX 工具和国外的比,差在哪? 16. 自建 XX 和买现成的,哪个更划算? 17. YY 有哪些同类竞品? 18. 预算相同的情况下,XX 该怎么在几家里取舍?
场景 / 约束类(P0–P1,6 条 · 全部无品牌) 19. 预算有限的小团队做 XX 该怎么选? 20. 跨境电商做 XX 用什么比较合适? 21. ZZ 行业做 XX 一般怎么做? 22. 刚起步的公司需要做 XX 吗,从哪一步开始? 23. 只做国内市场的话,XX 该怎么配置? 24. 既要覆盖国内又要覆盖海外,XX 怎么选?
信任 / 尽调类(3 条 · 记情感极性,不记提及率) 25. YY 靠谱吗? 26. YY 有什么缺点或者被吐槽的地方? 27. 用 YY 的人评价怎么样,有踩过坑吗?
认知 / 教育类(P2,3 条 · 主要看引用来源) 28. 什么是 XX,为什么现在很多公司开始做? 29. XX 一般怎么做,大致流程是什么? 30. XX 的效果怎么衡量?
跑完这 30 条之后,最值钱的产出不是那个百分比,而是两份清单:① 你完全缺席的问题(内容缺口);② 所有出现过的被引来源域名去重列表(这个品类的信源地图)。完整的跨引擎执行流程见如何监测品牌在国内 AI 搜索里的可见度。
常见问题(FAQ)
GEO 监测的提问集该写多少条? 看你要分辨多大的变化。50 条 × 3 次 = 150 次采集,只够看出 10 个百分点以上的变化;要稳定看出 5 个百分点,需要约 650 次,也就是 200 条以上 × 3 次。第一次摸底 20–30 条够用,常规运营 50–80 条,要汇报涨跌就往 150–250 条走。
同一条问题每轮要跑几次? 至少 3 次,每次新开对话,否则无法区分「确实没被提及」和「这次恰好没被提及」。但同题多次采样是相关样本,同样预算下加题比加次数更划算。
提问集里可以放我自己的品牌名吗? 可以,但必须单开一个分母。含品牌名的问题提及率天然接近 100%,混进总数会系统性抬高整体指标。建议无品牌问题占 70% 以上。
提问集定了以后还能改吗? 能增补,不能随手改。冻结至少 6 轮;扩充就开 v2 并让 v1 并行跑 3 轮做桥接;每次变更在趋势图上打注释线。
「X 有什么缺点」这类负面问题要不要放? 要放,但指标方向是反的。记情感极性和被引用的负面来源 URL,不要记提及率。
国内和海外能共用一套提问集吗? 不能直接共用。中文题和它的英文译版是两条不同的题,信源池完全不同。用同一套结构在两个市场各自本地化,分开算分母。
先把分母定对,再谈提升
GEO 里最贵的错误不是「优化没做好」,而是用一份错的提问集测了半年——品牌词占了一半、每题只跑一次、中途改过三版,最后拿着一条没有意义的曲线去开会。
分母定对了,剩下的事就变得简单:哪些问题你完全缺席,就是内容该补的地方;哪些来源反复被引用,就是你该去被提及的地方。
如果你不想手工跑那几百上千次对话,闻响 GeoEcho 支持导入你自己的提问集,同时在国内(豆包 / DeepSeek / Kimi / 元宝 / 通义 / 百度 AI)和海外(ChatGPT / Perplexity / Gemini) 引擎上按固定周期重跑,分引擎、分面记录提及率、推荐率与被引来源。还没想好问什么,也可以先输入域名跑一次免费快照,让它给你一份起步提问集。
常见问题
GEO 监测的提问集该写多少条?
看你要分辨多大的变化。提及率是一个比例,它的抽样误差只取决于每个引擎每轮的总采集次数 n(= 题数 × 每题采样次数)。按二项分布估算:50 条 × 3 次 = 150 次,只够看出 10 个百分点以上的变化;要稳定看出 5 个百分点的变化,需要约 650 次,也就是 200 条以上 × 3 次。所以第一次摸底 20–30 条够用,常规运营建议 50–80 条,要拿去汇报涨跌或做优化前后对比,就得往 150–250 条走。
同一条问题每轮要跑几次?
至少 3 次,每次新开对话。跑 1 次的问题无法区分「这条我们确实没被提及」和「这一次恰好没被提及」——AI 每次生成的答案都不同。3 次是下限,5 次更稳。但要注意:同一条问题的多次采样是相关的,在同样的采集预算下,把题数从 50 加到 100,比把每题次数从 3 加到 6 更能压低误差。
提问集里可以放我自己的品牌名吗?
可以放,但必须单独一个分母,永远不要和无品牌问题合并计算提及率。问题里出现你的品牌名,AI 几乎必然会提到你——这类问题的提及率天然接近 100%,混进总数会把整体指标系统性抬高。品牌词问题测的是「AI 对你的描述准不准」,无品牌的品类词、对比词才测「用户问这类问题时 AI 推不推荐你」。建议无品牌问题占七成以上。
提问集定了以后还能改吗?
能增补,不能随手改。提问集就是你所有可见度指标的分母,中途换题等于换考卷,前后数据不可比。规则是:冻结至少连续 6 轮(每两周一轮约 3 个月)不动;确需扩充就开 v2,同时让 v1 继续并行跑 3 轮做桥接,趋势线才不会断;每次版本变更都要在趋势图上标一条注释线。
「X 有什么缺点 / X 靠谱吗」这类负面问题要不要放进去?
要放,但指标方向是反的,必须单列。这类问题里你的品牌名本来就在问句里,提及率永远 100%、毫无信息量;该记的是情感极性(正面 / 中性 / 负面)和 AI 具体引用了哪条负面来源 URL。有了来源 URL,负面才从「感觉不好」变成可处置的对象。
国内引擎和海外引擎能共用一套提问集吗?
不能直接共用。中文问题和它的英文译版是两条不同的题,检索到的信源池完全不同,不能算作同一条做对比。而且各引擎还有「面」和「模式」的差别——豆包 API / 网页 / App 的引用不是同一套,DeepSeek 要手动开联网才给来源。正确做法是:一套问题结构(五类场景配比)在两个市场各自本地化成两套题,分开算分母,报表里标清语言和面。