guide

花钱把品牌「植入」AI 答案,甲方怎么自己验收:一套跑得动的复测协议(2026)

3·15 曝光 GEO「投毒」之后,付费植入 AI 答案这门生意没停,只是话术变了。这篇不讲怎么买,只讲买了之后甲方怎么自己验收:为什么截图不算数、复现率怎么测、留一组不给服务商的对照词、六种让报告变好看的手法怎么反制,以及刷进去之后可能付出的代价。

花钱把品牌「植入」AI 答案,甲方怎么自己验收:一套跑得动的复测协议(2026)

一句话结论:付费「植入 AI 答案」的验收,不能看截图,只能看复现率——同一批固定问题、同样的引擎与面、重复跑 N 次,投放前后各跑一轮,再留一组不给服务商的对照词做参照。只有「投放词的复现率涨了、对照词没动」才算这笔钱有效。而在 2026 年 3·15 晚会曝光 GEO「投毒」黑产之后,验收还多了一层:你得确认服务商用的是真实内容+可信信源,而不是批量软文、虚构测评、伪造专家身份——后者已经有品牌因此被 AI 平台标记为「不可信信息源」。

为什么写这篇:搜「花钱植入 AI 答案」,今天中文互联网返回的是三类内容——媒体写现象(腾讯新闻 / 36氪《花一万元植入 DeepSeek》、央视 3·15 曝光),服务商写怎么发稿的接单文,知乎写**「这套已死」**的唱衰文。中间那个位置是空的:已经掏了钱、正在怀疑效果的甲方,怎么自己验收? 这篇只答这一个问题。

立场声明:我们做的是测量工具,不接 GEO 代运营。这篇不点名任何服务商,也不提供任何「怎么刷」的操作路径——它是给买方的核验方法,不是给卖方的攻略。

时效声明:本文事实核查于 2026 年 8 月 7 日。这个行业在 3·15 之后处于洗牌期,各家话术与合规口径变化很快,涉及具体合作前请自行复核当前状态。


一、先把「你买到的到底是什么」说清楚

绝大多数验收纠纷,源头都在这里:买卖双方对交付物的理解从一开始就不是一回事

把市面上叫「GEO」「AI 答案植入」「大模型推荐优化」的服务拆开,实际只有三类:

你买的是实际交付物谁能控制结果怎么验收
A. 内容生产与分发(最常见)定制文章 + 批量分发到第三方站点服务商控制发了什么、发到哪,控制不了 AI 引不引验发布物(可见、可核)+ 验复现率(统计)
B. 自有资产改造官网 / 落地页结构改造、FAQ、实体信息统一服务商完全可控验交付物本身,最容易验
C. 承诺位次(「保证进前 3」)——没有人能控制无法验收,因为它承诺的东西不存在

关于 A 的标准操作,媒体已经写得很清楚。据腾讯新闻 / 36氪 2025 年 9 月转载的报道《花一万元植入 DeepSeek,一场没有终点的流量游戏》,通行做法是:客户提供公司信息与产品卖点 → 服务商定制「AI 友好」的文章 → 批量分发到门户与地方媒体,通常需要 40–50 篇才见初步效果,按关键词数或问题数计费。

三条推论,每一条都能省钱:

  1. A 和 B 常被打包报价,但验收方式完全不同。 B 是所见即所得,A 是概率性影响。要求分开列价、分开验收。
  2. C 根本不该出现在合同里。 AI 答案不是一张有固定槽位的排行榜——没有「第 3 位」这个可被采购的位置。这条边界我们在豆包能花钱买推荐位吗里已经完整立过一次:截至 2026 年 8 月,国内主流 AI 引擎的对话答案里不存在可购买的自然推荐位
  3. 「模型收钱给位置」和「往信源里加内容」是两件事,被话术故意混在一起。 你付的钱影响的是信源侧的信息密度,不是模型的排序权重。理解这一点,你才知道该验什么。

不同交付形态的报价逻辑与成本结构,见GEO 优化到底多少钱:报价从 3000 到 100 万


二、为什么截图不能当验收凭据

这是本文最重要的一节。

21 世纪经济报道记者肖潇在 2026 年 3 月 30 日的调查《求证了 1028 遍 AI 回复:泛滥的 GEO,割了多少韭菜?》里,把行业通行的「效果证明」方式写得很直白:多数服务商会向 AI 搜索工具提交一系列预设问题,统计回复中品牌被提及的次数,以此作为主要效果证明。同一篇报道的结论是:这门生意目前效果不稳定、转化难评估,品牌方难以准确衡量优化效果。

问题不在于「统计提及次数」这个动作,而在于这个动作被执行时通常缺了三样东西:

漏洞一:没有重复 —— 一次出现证明不了任何事

AI 答案是每次生成的。同一个问题、同一个引擎,换个会话、换个账号、隔一天再问,结果就可能不同。所以:

  • 一张截图能证明的,只有「这个组合至少发生过一次」;
  • 无法排除:跑了 20 次,挑了最好的那一次;
  • 验收的最小单位必须是复现率——同一条问题在同样条件下重复 N 次,其中有几次提到你。「5 次里 4 次」是数据,「有一次提到了」不是。

漏洞二:没有对照 —— 涨了不等于是你买的那件事让它涨的

品牌自然增长、行业热度上升、引擎自己更新了索引,都会让提及率变化。没有对照组,任何「提升」都可以被归功给服务商,也可以被归咎给别的东西——双方都无法证伪,最后谁声音大谁赢。第三节会给出对照组的具体做法。

漏洞三:没有分母 —— 「提及率 32%」到底是什么除以什么

提及率的分母可以是问题数、可以是问题数 × 采样次数、可以再乘引擎数。分母不同,同一批原始数据能算出差好几倍的百分比。 更麻烦的是跨周对比:这周加了 10 条问题、下周少跑了一个引擎,分母一变,趋势线就是假的。指标名词的分母定义见GEO 术语表,提问集本身怎么设计见GEO 监测的提问集怎么设计

一句话记住没有重复的数据是轶事,没有对照的提升是巧合,没有分母的百分比是修辞。 三样缺一样,这份报告就不能作为付款依据。


三、一套甲方自己能跑的验收协议(7 步)

这一节可以直接抄进合同附件。整套协议不需要任何技术能力,手动也跑得动——只是费时间。

第 0 步:签约当天冻结提问集

  • 双方书面确认一份 30–100 条的问题清单,写进合同附件;
  • 结构建议:品类词 / 选型词占 60%–70%(「XX 哪个牌子好」「有没有推荐的 XX 供应商」)、对比词 20%(「A 和 B 哪个好」)、品牌词不超过 10%
  • 中途不得单方面增删。确需变更走书面确认,且旧清单必须继续跑,否则趋势断档。

为什么品牌词要压到 10% 以下:问「XX 品牌怎么样」时 AI 几乎必然提到你——把品牌词混进分母,提及率天然虚高,KPI 自动达标。这是最常见、也最不容易被察觉的美化手法。

第 1 步:投放开始之前,先跑一轮基线

这是整套协议里唯一有时间窗口的动作,事后补不出来。 没有基线,后面所有「提升」都无法证伪。哪怕只有半天时间,也要把基线跑完再让服务商开工。

手动最小流程见怎么免费自查品牌在 AI 里有没有被提到

第 2 步:留一组「不给服务商」的对照词 ⭐

这是甲方手里最有力、也几乎没人用的那张牌。

从提问集里留出 20%–30% 的问题作为对照组(holdout)

  • 这些问题不写进给服务商的关键词 / 问题清单,服务商不知道你在测它们;
  • 但你自己照常按同样频率监测
  • 对照词要和投放词同品类、同难度(别拿冷门长尾当对照,那不公平也不可信)。

读法只有三种,非常干净:

投放词对照词结论
持平这笔钱有效 ——这是你要的那个结果
大概率是行业热度 / 品牌自然增长 / 引擎更新,不是服务商的功劳
持平持平没效果(或还没到时间,继续跑)
持平检查你的投放是不是把内容做窄了,反而错过了自然增长

为什么它有效:对照词是服务商唯一无法影响、也无法事后解释掉的证据。凡是拒绝接受留出对照组的合作方,理由通常是「这样效果会被低估」——而那恰恰说明他知道自己的数字里混着不属于他的部分。

第 3 步:把采样条件写死

不写死,两期数据就不可比。至少定死这 6 项:

条件写成什么不写死会怎样
重复次数每条问题每引擎 N 次(建议 5–10),前后期必须一致次数变了,百分比不可比
引擎与「面」列出引擎名,并写明测的是 API / 网页 / App 哪个面三个面结果不是同一套,实测见这里
登录状态统一「未登录 / 新会话」或统一「登录固定测试账号」个性化与历史上下文会污染结果
联网开关明确开或关(DeepSeek 尤其关键)DeepSeek 不开联网不给引用来源,会误判成「0 引用」
时间分布2–3 天分批跑,别集中在一个时段同一时段的缓存 / 热点会让样本高度相关
原始记录留存完整答案文本 + 时间戳,不只是结论事后有争议时没法回看

关于每条跑几次:这是采样常识、不是我们的实测结论——跑 3 次只能分辨 0 与 3 这种极端差别;跑 10 次时一次波动就等于 10 个百分点,意味着小于 10 个百分点的「提升」在这个样本量下读不出来。你想识别多细的变化,就得跑多少次。

第 4 步:每次采样记这 8 个字段

字段记什么为什么必须有
engine / surface引擎 + API/网页/App分面统计的基础
prompt_id对应提问集里的哪一条跨期对齐的唯一键
run_index这是第几次重复算复现率的分母
mentioned答案里有没有提到你提及率
recommended是不是被当作推荐项(不只是被提到)被提到 ≠ 被推荐,这是两个指标
position在推荐列表里第几个出现趋势用,不作为承诺
cited_urls答案给出的引用来源链接最难造假的一项,第五节要用
full_text完整答案原文争议时的唯一凭据

recommendedmentioned 一定要分成两列。很多「效果显著」的报告,涨的全是 mentioned(被顺带提了一句),而离生意最近的 recommended 一动没动

第 5 步:判定线怎么写进合同

不要写「提及率达到 X%」——分子分母都在对方手里的绝对值,是最容易被做出来的数字。改写成相对判定:

  • ✅ 「投放词的推荐率相对基线提升 ≥ N 个百分点,且同期对照词提升 < N/2
  • ✅ 「至少 M 条投放问题上,出现指向双方确认过的目标 URL 的引用来源」
  • ❌ 「进入 AI 答案前 3 位」(不存在这个位)
  • ❌ 「提及率 ≥ 50%」(分母可调)

N 取多少? 应该由你自己基线的波动幅度决定:先看基线期内同一批问题两次采样之间自然波动了多少个百分点,判定线至少要大于这个波动,否则你在为噪声付款。在有可发布的自有样本之前,本文不给出「正常周间波动幅度」的具体参考区间。

第 6 步:复测频率与「交接保护」

  • 频率:投放期每 1–2 周一轮,用完全相同的条件;
  • 交接保护:原始记录存在你自己这边,不是服务商的后台。换服务商时历史数据不断档,新旧才有得比——这也是续约谈判时你手里唯一一份对方无法编辑的事实。

自建还是买工具来跑这套协议,成本账见自己写脚本监测 AI 提及,还是买工具;完整的分引擎监测流程见如何监测品牌在国内 AI 搜索里的可见度


四、六种让报告变好看的手法,以及各自的反制

这些手法不一定出于恶意——很多是「选择性地测那些好看的问题」这种无意识的漂移。但结果一样:你为一个不存在的提升付了钱。

#手法报告上看起来反制(一句话)
1提问集里堆品牌词提及率 80%+品牌词占比压到 10% 以下,且单独列一行,不混进总分母
2引导性提问(「XX 品牌怎么样」「XX 是不是行业领先」)几乎条条命中判定只认无品牌的品类词 / 选型词
3中途换提问集曲线漂亮地向上提问集写进附件,变更须书面确认且旧清单继续跑
4只测最容易的那个面数字普遍偏高合同写明测哪个面;用户在哪个面,就以哪个面为准(国内多数在 App)
5单次截图 + 挑最好的那次「你看,已经上了」只认复现率,要求全部 N 次的原始记录,不接受挑选后的截图
6用冷门长尾词凑数命中率很高每条问题标注是否有真实搜索需求;对照词必须同难度

还有一种更隐蔽的:把自家分发站的镜像稿当作「被 AI 引用」。答案里出现的引用链接确实存在,但它指向的是服务商自己批量分发的那批稿件所在的站点——这不是第三方背书,是自证。第五节专门讲怎么识别。

一条通用规则:任何 GEO 交付,都应该能落到一个你自己能打开、能核对的可见物上——发了哪些稿、发在哪些站、什么时候发的、链接给你。落不到具体链接的承诺,卖的是一个你看不见的东西。 这条与工具榜单的核验逻辑同源,见GEO 工具排行榜是怎么来的


五、信源健康度自查:比提及率更早暴露问题的三个信号

提及率是滞后指标。信源结构是先行指标——它通常在数字变差之前就已经不对劲了。

拿到 cited_urls 之后,算三件事:

信号一:来源集中度

统计所有被引用链接的域名分布。如果前 2–3 个域名就占了大半,说明你的 AI 可见度建立在极少数几个站点上。这本身就是脆弱信号:一旦这些站被引擎降权,你的可见度会一次性归零,而不是缓慢下滑。

信号二:同稿多站镜像

把被引用页面的正文比对一下。如果多个域名上是同一篇稿子改了标题,那它在引擎眼里大概率是同一个信息源的复制品,不是多个独立信源的相互印证。镜像稿的数量不产生可信度,只产生冗余。

信号三:信源类型分布

给每个被引域名打个类型标签,做一张分布表:

信源类型举例健康的样子
自有官网、官方文档、官方公众号该有,但不能只有它
权威 / 官方行业协会、监管公示、百科、企查查类实体信息越多越稳,是「实体地基」
第三方真实讨论知乎回答、垂直社区、真实测评最难做也最值钱
付费分发站 / 软文站批量发稿渠道有一点正常,占比过高就是风险

判定方法很朴素:把这张表拿给一个不了解你行业的同事看,问他「这些来源里,哪些是别人主动写你的,哪些是你花钱让人写的」。他能一眼分出来的比例,大概就是引擎迟早也能分出来的比例。

另外一个常被忽略的基础核查:引擎的爬虫到底有没有抓过这些页面。服务商说「已被收录」,你可以从自己的服务器日志里直接确认国内 AI 爬虫的真实抓取情况——方法见怎么从服务器日志确认豆包、元宝真的抓过你的站


六、刷进去了会怎样:3·15 之后的三个真实后果

这一节不是危言耸听,是 2026 年上半年已经发生过的事。验收 GEO 不只是验效果,也要验做法——因为做法的代价最后由品牌方承担。

事实一:3·15 晚会点名了这条产业链

2026 年 3 月 15 日,央视 3·15 晚会曝光了 GEO 给大模型「投毒」的黑产:服务机构批量发布软文、伪造测评报告、编造专家身份,把定制内容「投喂」进大模型的信息来源,使商业推广以「AI 标准答案」的形态出现在用户面前(新华网 2026-03-20 评论21 经济网 2026-03-1636氪)。

据公开报道,记者用一个完全虚构的智能手环(AstroTekk Apollo-9) 做验证:靠自动生成的虚假测评与用户评分批量分发,它在 DeepSeek、豆包、元宝、千问、文心一言、Kimi 等多个主流大模型里被列为推荐产品。

⚠️ 口径提醒:不同媒体转述的细节存在出入——生效时间有「两小时内」与「三天内」两种说法,价格档位有「39.9 元」与「6600 元/年」两种说法(很可能是不同产品档)。这些差异不影响结论,但引用具体数字前请以央视原节目为准。

事实二:已经有品牌被 AI 平台标记为「不可信信息源」

21 世纪经济报道 2026 年 3 月 30 日的调查里记录了一个案例:一家国际物流公司没有等来服务商承诺的「AI 搜索前三排名」,反而因为对方批量生成未核实信息,被多个 AI 平台标记为「不可信信息源」原文)。

这是本文最值得记住的一句话:这类操作的失败模式不是「白花钱」,而是「花钱把自己做进了黑名单」。 一旦域名或品牌实体在信源侧被降权,受损的不只是这次投放的内容,而是你全部的自然可见度——包括官网、包括你老老实实做了两年的那些内容。

事实三:治理方向正在指向「信源黑白名单」

新华网 2026 年 3 月 20 日的评论文章给出的治理建议里,明确包含建立数据来源可信度评估机制、对检索来源实行黑白名单,以及在反不正当竞争执法中明确「针对 AI 系统的恶意投喂与操纵行为」。

同时,21 世纪经济报道 2026 年 7 月 20 日的《3·15 后时代的 GEO:出圈、洗牌、等待 AI 打开黑匣子》记录了行业侧的变化:3·15 之后行业洗牌加速,合规成为重点,企业客户的问题从「能不能让 AI 推荐到第一」转向「具体怎么操作、合不合规」。

读法:治理方向是「提高权威信源权重、给可疑信源降权」。这意味着靠低质批量分发换来的可见度,其半衰期正在被主动缩短——它不是一个能沉淀的资产。

相关法条(复述公开条文,不构成法律意见)

法规关键条款生效时间
《反不正当竞争法》(2025 年修订)虚假评价明确纳入虚假宣传;欺骗、误导的对象从「消费者」扩展到「消费者和其他经营者」;禁止组织虚假交易、虚假评价2025 年 10 月 15 日施行
《互联网广告管理办法》(市场监管总局令第 72 号)第九条:互联网广告应具有可识别性;竞价排名的商品或服务须显著标明「广告」,与自然搜索结果明显区分2023 年 5 月 1 日施行

对品牌方的直接含义:广告法体系下,掏钱的一方本身是责任主体之一,「我不知道服务商怎么做的」通常不构成免责理由。如果服务商为了把你做进答案而生成了夸大或不实的描述(「行业第一」「XX 认证」),出事时被追的是品牌。

反过来,如果 AI 里已经出现了关于你的错误信息,正确路径是信源纠错而不是继续盖内容,见AI 把我公司信息说错了怎么改;负面处置流程见AI 答案里出现品牌负面怎么办

⚠️ 免责说明:本节仅复述公开法规原文与公开媒体报道,不构成法律意见,也不针对任何具体公司。具体合作前请咨询你自己的法务或执业律师。


七、一页纸验收判定表

跑完一轮,对照下表下结论。建议把这张表直接贴进付款流程。

档位判据(需同时满足)动作
✅ 合格投放词推荐率相对基线提升超过基线波动幅度;对照词基本持平;出现指向确认目标 URL 的引用;信源类型分布里付费分发站不占主导正常付款,进入下一轮
🟡 部分合格投放词的 mentioned 涨了但 recommended 没动;或涨幅存在但对照词也在涨付部分款;要求下一轮把动作聚焦到选型 / 对比类问题
🟠 存疑数字漂亮但你自己抽样复测不出来;或引用来源高度集中在少数几个域名、存在同稿多站镜像暂停付款,要求现场演示口径 + 提供全部原始记录
🔴 不合格提问集被中途更换;只有截图没有 N 次原始记录;出现虚构测评 / 伪造专家身份 / 编造数据的内容终止合作;对已发布的不实内容启动撤稿与信源纠错

抽样复测怎么做(最低成本的独立校验):从他给的提问集里随机抽 10 条,你自己在豆包、DeepSeek、元宝各问一遍,每条问 3 次。允许有出入(AI 本来就会变),但如果他报的数字明显高于你抽测的结果,或者他给的引用来源你一条都复现不出来,就进入「存疑」档。

服务商选型阶段的完整防坑清单(8 个危险信号、每月报告必含 5 项),见GEO 服务商怎么选、怎么验收——那篇管签约前,这篇管签约后


常见问题(FAQ)

服务商发来的截图上确实提到了我们,算验收通过吗? 不算。AI 答案每次生成都可能不同,一次「出现了」可能是偶然,也可能是跑了 20 次挑出来的那一次。验收的最小单位是复现率——同一条问题在同样条件下重复 N 次,其中有几次提到你。「5 次里 4 次」是数据,「有一次提到了」不是。

验收 GEO 发稿最关键的一步是什么? 留一组不给服务商的对照词。从提问集里留出 20%–30% 的问题,不写进给对方的清单,但你自己照常监测。投放词涨、对照词不动,才证明这笔钱有效;两边一起涨,那是行业热度或品牌自然增长。这是服务商无法影响也无法事后解释掉的唯一证据。

3·15 曝光的「AI 投毒」和我买的 GEO 发稿是一回事吗? 不一定,但共用同一条生产线。3·15 晚会曝光的是批量发软文、伪造测评与专家身份向大模型「投喂」内容的产业链;合规 GEO 做的是同一动作的合法版本——把真实、可核实的信息以易抽取的结构放到可信信源上。区别不在技术手段,在内容是否真实、身份是否伪造、评价是否虚构。所以验收要同时问「有没有效果」和「用的是哪种做法」。

刷进去的代价在谁身上? 双方都有,品牌方跑不掉。21 世纪经济报道 2026 年 3 月 30 日的调查提到,一家国际物流公司因服务商批量生成未核实信息,被多个 AI 平台标记为「不可信信息源」。法规侧,《反不正当竞争法》(2025 年修订,2025-10-15 施行)已把「虚假评价」纳入虚假宣传,《互联网广告管理办法》第九条要求广告可识别。广告主本身是责任主体,「不知道服务商怎么做的」通常不免责。本文不构成法律意见。

每条问题要跑多少次? 取决于你想识别多大的变化。跑 3 次只能看出极端差别;跑 10 次时一次波动就是 10 个百分点,小于 10 个百分点的「提升」读不出来。实务折中是每条每引擎 5–10 次、跨 2–3 天分批跑,且投放前后次数完全一致。

服务商说「口径不同所以数字对不上」,成立吗? 口径不同确实会让数字对不上,但那是签约时该钉死的东西,不是验收时才拿出来的解释。合同附件里写清四项:提及率的分子分母、测的是哪个引擎的哪个面、账号是否登录、是否开联网。钉死之后双方数字应在同一量级。拒绝把口径写进附件的,验收从一开始就不成立。


结论:验收权在谁手里,钱就在谁手里

关于付费植入 AI 答案,今天能确定的只有三句话:

  1. 你买的是信源侧的信息密度,不是模型里的一个位置——所以「保证第几位」这种承诺,不是难兑现,是不存在。
  2. 一次截图什么都证明不了——验收的最小单位是复现率,而复现率必须配对照组才有意义。
  3. 做法本身也要验——3·15 之后,靠虚构内容换来的可见度不只会失效,还可能把品牌做进「不可信信息源」那一栏。

这三句话推出同一个动作:在服务商开工之前,先把基线、提问集和对照组定下来。 顺序反了,你就永远只能听对方报数——而这恰恰是整个交易里唯一真正重要的那件事。

顺带说一句:这套验收里最关键的两项——分引擎、分面(API / 网页 / App)记录,以及对照组的跨周稳定采样——欧美 GEO 工具在中国引擎上做不到,它们连豆包 App 面都没有采集能力(对照见海外 AI 可见度工具在中国的盲区)。

闻响 GeoEcho 用固定提问集、固定采样次数,持续跟踪品牌在国内(豆包 / DeepSeek / Kimi / 元宝 / 通义 / 百度 AI)与海外(ChatGPT / Perplexity / Gemini)AI 引擎里的提及率、推荐率与被引来源,分引擎、分面记录,历史数据留在你这边。想在下一笔 GEO 预算花出去之前先留一条基线,输入域名跑一次免费查询即可。


本文事实核查于 2026-08-07。所有涉及第三方的表述均复述自公开媒体报道与公开法规原文,不针对任何具体公司,不构成法律意见。GEO 行业在 3·15 之后处于快速变化期,涉及具体合作请自行复核当前状态。

查看你自己的 AI 可见度

输入域名,30 秒内免费获取一份跨 ChatGPT、Perplexity、Gemini 和中国 AI 引擎的提及率快照。

免费查询 →

常见问题

服务商发来一张 AI 答案的截图,上面确实提到了我们,这算验收通过吗?

不算。AI 答案是每次生成的,同一个问题在不同会话、不同账号、不同联网状态下结果都不一样,任何一次「出现了」都可能是偶然。验收的最小单位不是「出现过」,而是复现率——同一条问题在同样条件下重复跑 N 次,其中有几次提到你。一次截图能证明的只有「这个组合至少发生过一次」,它无法排除服务商跑了 20 次挑了最好的那一次给你。

验收 GEO 发稿最关键的一步是什么?

留一组「不给服务商」的对照词。从你的提问集里留出 20%–30% 的问题,明确不写进给服务商的关键词清单,但你自己照常监测。如果投放词和对照词一起涨,说明涨的是行业热度或品牌自然增长,跟这笔钱没关系;只有投放词涨、对照词不动,这笔钱才被证明有效。这是甲方手里唯一一个服务商无法影响、也无法事后解释掉的证据。

3·15 晚会曝光的「AI 投毒」和我买的 GEO 发稿是同一件事吗?

不一定是同一件事,但共用同一条生产线。2026 年 3 月 15 日央视 3·15 晚会曝光了一条批量发软文、伪造测评与专家身份向大模型「投喂」内容的产业链,记者用一个完全虚构的智能手环做了验证。合规的 GEO 做的是同一个动作的合法版本:把真实、可核实的信息以 AI 好抽取的结构放到可信信源上。区别不在技术手段,在内容是否真实、身份是否伪造、评价是否虚构。所以验收时你要问的不只是「有没有效果」,还有「用的是哪种做法」。

刷进 AI 答案有什么代价,风险在服务商还是在品牌方?

在双方,且品牌方跑不掉。21 世纪经济报道 2026 年 3 月 30 日的调查里提到一个案例:一家国际物流公司没等来服务商承诺的「AI 搜索前三」,反而因对方批量生成未核实信息,被多个 AI 平台标记为「不可信信息源」。此外《反不正当竞争法》(2025 年修订,2025 年 10 月 15 日施行)已把「虚假评价」明确纳入虚假宣传,《互联网广告管理办法》第九条要求广告可识别、竞价排名须显著标明「广告」。广告法体系下掏钱的一方本身是责任主体,「不知道服务商怎么做的」通常不构成免责。本文不构成法律意见。

每条问题要跑多少次才够?

取决于你想识别多大的变化。跑 3 次只能看出 0 次和 3 次这种极端差别;跑 10 次,一次的波动就是 10 个百分点,也就是说小于 10 个百分点的「提升」在这个样本量下读不出来。实务上的折中是每条问题每个引擎跑 5–10 次、跨 2–3 天分批跑(避免同一时段的缓存与热点影响),并且投放前后用完全一样的次数——次数变了,两期数字就不可比。

服务商说他们的口径和第三方工具不一样,所以数字对不上,这个解释成立吗?

口径不同确实会让数字对不上,但那正是应该在签约时钉死、而不是在验收时才拿出来解释的东西。合理的做法是:合同附件里写清楚提及率的分子分母(问题数 × 采样次数 × 引擎数)、测的是哪个引擎的哪个面(API / 网页 / App)、账号是否登录、是否开联网。这四项定死之后,双方的数字就应该在同一个量级上。如果对方拒绝把口径写进附件,那验收从一开始就不成立。

GE
闻响 GeoEcho
GeoEcho 团队

闻响 GeoEcho 同时监测品牌在国内(豆包 / DeepSeek / Kimi / 元宝 / 通义 / 百度 AI)与海外(ChatGPT / Perplexity / Gemini)AI 引擎里的可见度。我们做测量、不接代运营,所以这类验收指南能站在甲方一侧写。事实逐条标注来源与核查日期。