一句话结论:GEO 监测采购最容易写废的地方不是价格,是口径——因为它没有国标、没有行标可以援引(《民法典》第五百一十一条那套兜底顺序在这里取不到值),合同里写「提升 AI 可见度」「监测准确率 99%」等于什么都没写。可执行的写法只有一种:把引擎与取数面、提问集、采样次数、指标分子分母、数据权属这 9 组参数写成需求书的技术参数条,再把验收条款写成甲方能自己重跑一遍的客观量化标准。下面两张表可以直接抄进你的需求书与合同附件。
这篇写给谁:正在起草 GEO 监测/AI 可见度采购需求书、比价单、SOW 或合同附件的甲方——市场部、采购、法务三方都要看的那一份文件。
立场声明:我们做的是测量工具、不接代运营。本文不点名任何服务商,也不提供任何「怎么让报告好看」的路径。
时效与免责:法规条文核对于 2026 年 8 月 24 日,均附官方链接。本文是采购实务整理,不构成法律意见,正式签约前请由你方法务审阅。
一、为什么 GEO 采购比一般软件采购更容易写废
普通软件采购写不细也未必出事,因为出事时有外部标准可以兜底。GEO 监测没有这个兜底。
《民法典》第五百一十一条规定了质量要求约定不明确时的履行顺序:先看强制性国家标准,没有则看推荐性国家标准,再没有则看行业标准,都没有才落到「通常标准或者符合合同目的的特定标准」(最高检公布的合同编条文)。
问题在于:截至 2026 年 8 月,「AI 可见度监测」这三级标准我们都没有检索到。于是所有 GEO 合同的质量争议,一上来就直接掉到最后那一档——「符合合同目的的特定标准」,也就是双方各说各话。
对比一下政府采购侧的要求会更清楚差距在哪。财政部《政府采购需求管理办法》(财库〔2021〕22 号)第二十四条明确要求:履约验收方案要明确验收的主体、时间、方式、程序、内容和验收标准;「验收内容要包括每一项技术和商务要求的履约情况,验收标准要包括所有客观、量化指标。不能明确客观标准、涉及主观判断的,可以通过在采购人、使用人中开展问卷调查等方式,转化为客观、量化的验收标准」(中国政府网原文)。同一份办法在采购需求的编制上也要求技术要求与商务要求应当客观,量化指标要明确对应的等级或区间。
这套要求本身完全适用于 GEO——难的是把 GEO 的指标变成「客观、量化」。因为这个品类里流通的绝大多数说法天然是主观的:
| 常见写法 | 为什么它不构成验收标准 |
|---|---|
| 「提升品牌 AI 可见度」 | 没有基线、没有指标、没有分母,任何结果都能自称达标 |
| 「监测准确率 ≥ 99%」 | 「准确率」在各家指的不是同一件事,且几乎没有一家公开分母与验证方法 |
| 「覆盖 12+ 主流 AI 平台」 | 不点名就无法核对;同一引擎的 API / 网页 / App 是三套不同的数据 |
| 「保证进入 AI 推荐前三」 | 承诺的对象不存在——对话答案里没有固定槽位 |
| 「每月提供优化报告一份」 | 只约束了份数,没约束内容与口径 |
各家「准确率 99.x%」互相不可比的具体证据,我们在国内 GEO 监测工具公开口径对照里逐条抄了原话;那些互相矛盾的榜单排序是怎么来的,见GEO 工具排行榜是怎么来的。采购文件里不要引用任何一家的自宣数字作为技术参数——它会变成你验收时唯一的依据,而它的分母不在你手里。
二、需求书技术参数表:9 组参数(可直接抄)
这张表是本文的主体。左列是参数名,中列给出可执行的写法(照抄改数即可),右列说明写成什么样等于没写。
表 A:GEO 监测采购需求书 · 技术参数条
| # | 参数组 | 需求书里的可执行写法 | 等于没写的写法 |
|---|---|---|---|
| 1 | 引擎清单 | 逐个点名:国内含豆包、DeepSeek、元宝、通义千问、Kimi、百度 AI、夸克;海外含 ChatGPT、Perplexity、Gemini。每个引擎单列一行数据,不得合并为综合指数 | 「覆盖主流 AI 平台 12+」 |
| 2 | 取数面 | 逐引擎写明取自 API / 网页端 / 手机 App 中的哪一个;同一引擎取多个面的,分面分别出数 | 「覆盖豆包」——三个面三套结果,不写等于三选一由乙方决定 |
| 3 | 会话与联网状态 | 每次采样是否新开会话、是否登录账号、是否固定开启联网检索、地域与语言设置,全部固定并写入附件 | 不提。DeepSeek 未开联网时不给引用来源,一行「引用数 0」有两种完全不同的含义 |
| 4 | 提问集 | 规模(如 60–100 条)、构成配比(品类词 / 对比词 / 场景词 / 少量品牌词)、全文作为合同附件、著作权与使用权归甲方 | 「围绕品牌关键词监测」——只测品牌词的提及率天然接近满分 |
| 5 | 提问集变更控制 | 增删须书面确认;变更当期新旧两套并行跑一期,出具可比性说明;旧集继续保留 | 允许乙方按月「优化提问集」——换了考卷的提升不是提升 |
| 6 | 采样次数与节奏 | 每条提问 × 每个引擎 × 每周期采样 N 次(N 写死)、跨 2–3 天分批、投放前后 N 保持一致 | 「定期监测」。采样次数直接决定分辨率:N=10 时,小于 10 个百分点的变化读不出来 |
| 7 | 指标定义 | 逐个写分子分母:提及率=提及的采样次数 ÷(提问条数 × 采样次数);推荐率限定在「该选哪个 / 有哪些好用的 X」类提问内;被引来源 URL 明细为必交项;另含情感与错误描述 | 「提及率」「AI 可见度得分」——不写分母,两家报出的 30% 不是一个东西 |
| 8 | 数据交付与导出 | 原始记录可导出:完整答案文本 + 来源清单 + 时间戳 + 引擎与面标记;格式(CSV/JSON)与交付频率写明;报告与原始数据同步交付 | 只给看板截图或 PDF 报告——不可复核、不可迁移 |
| 9 | 数据权属与退出 | 监测数据与历史记录归甲方所有;合同终止后提供不少于 X 天的完整导出窗口;乙方留存与再利用范围写明;甲方保留用第三方工具复测的权利 | 不约定。换供应商时历史数据断档,所有趋势线从零开始 |
三条使用说明:
- 第 1–3 行是可比性的地基,其余六行建立在它们之上。取数面不写死,后面所有数字都失去意义——同一个引擎的 API、网页和 App 给出的答案与引用来源不是同一套,这一点我们做过实测拆解:豆包的 API、网页、App 引用不是同一套。
- 第 4–6 行决定「提升」能不能被证伪。提问集怎么设计、写多少条、每条跑几次才算数,展开在GEO 监测的提问集怎么设计。
- 第 7 行的指标名词如果三方理解不一致,附一份定义清单进合同附件;可以直接引用我们的GEO 术语表作为基础版本再按需修改。
按采购类型加写的条款
表 A 的 9 组参数两类采购通用。差异在这里:
| 买监测工具(SaaS 订阅) | 买代运营服务(GEO 优化) | |
|---|---|---|
| 额外必写 | 席位数与工作区数;多品牌 / 多市场的数据隔离方式;配额用尽后的行为(停跑还是超额计费);订阅期内的引擎增减是否调价 | 开工前基线报告(无基线则后续所有「提升」不可证伪);交付物清单;报告交付日;甲方第三方复测权 |
| 计价单位要钉死 | 一次采样=一条提问 × 一个引擎 × 一次;否则「不限量」与「10 万次」无法比价 | 按提问数 / 按引擎数 / 按月,以及超出部分单价 |
| 常见陷阱 | 报价按「监测关键词数」计,但没说每个词每周期跑几次 | 把内容生产与自有资产改造打包报价,验收方式却完全不同 |
工具侧的公开报价与「这个价买到几次采样」的换算,见GEO 监测工具多少钱;服务侧从 3000 到 100 万的报价结构拆解,见GEO 优化到底多少钱。还没决定该买工具还是自己写脚本的,先看自己写脚本还是买工具。
三、验收条款表:把「客观、量化」落到 GEO 上
验收要分三级,只有前两级能写成合同硬指标。
- 一级 · 交付验收:约定的东西有没有交付到位(引擎、席位、提问集、报告、导出)。完全客观,最好验。
- 二级 · 口径验收:交付的数字可不可复核——甲方按同样口径自己重跑,结果是否落在容差带内。这是 GEO 验收的核心。
- 三级 · 效果验收:提及率 / 推荐率有没有涨。只能作为观察项与续约依据,不能作为付款条件的唯一硬指标——AI 答案的生成有天然波动,且外部因素(竞品动作、引擎版本更新、信源生态变化)不受乙方控制。
表 B:GEO 监测验收条款(客观量化标准 · 可直接抄)
| 验收项 | 客观、量化的验收标准 | 需提交的证据材料 | 不通过的处理 |
|---|---|---|---|
| 引擎与取数面覆盖 | 附件所列每个引擎均有独立数据行,且每行标注取数面(API/网页/App);缺任一引擎或缺面标记即为不通过 | 报告原表 + 原始记录导出文件 | 限期 X 个工作日补齐,逾期按未交付计 |
| 提问集一致性 | 本期使用的提问集与附件逐条一致;有变更的须附书面确认与新旧并行一期的对照数据 | 本期实际提问清单(全文) | 变更未确认的,本期数据不作为趋势对比依据 |
| 采样次数达标 | 每条提问 × 每引擎实际采样次数 ≥ 附件约定的 N;失败与重试单独列示 | 带时间戳的原始记录 | 达标率低于约定比例的,本期不计费或按比例结算 |
| 口径可复现(核心) | 甲方随机抽取 10 条提问,按附件口径自行复测;单条「是否提及」判定与乙方报告不一致的不超过 N 条(N 由双方按采样次数与容差带商定) | 甲方复测记录 + 乙方同期原始记录 | 超出容差的,双方现场同步对跑一轮,以附件口径为准;连续两期超出的触发整改条款 |
| 被引来源 URL 明细 | 每条被引来源可定位到:哪个引擎、哪条提问、哪次采样、引了哪个 URL;不接受汇总数量 | 明细表(可导出) | 只给汇总数量的视为该交付项缺失 |
| 数据可导出 | 在验收会当场执行一次完整导出,导出文件含完整答案文本、来源清单、时间戳、引擎与面标记 | 导出文件本体 | 无法当场导出的,视为第 8 组参数未实现 |
| 报告按时交付 | 每期报告在约定交付日 T+X 内送达,含分引擎对比与竞品对照 | 交付记录 | 按合同违约条款处理 |
| 效果趋势(观察项) | 与基线对比的分引擎提及率 / 推荐率变化,列示但不单独作为付款条件 | 基线报告 + 本期报告 | 连续 N 期无变化时触发方案复盘,而非直接扣款 |
关于容差带:这是 GEO 验收和普通软件验收最不一样的一条。同一条提问重复跑会得到不同答案,因此「甲乙双方数字必须完全一致」是一条无法履行的条款,写进去反而会让整个验收流于形式。可执行的写法是:先固定采样次数 N,再约定单条判定的允许不一致条数与连续超差的处理。抽检复测的具体跑法(怎么抽、怎么记、为什么截图不算数),我们在花钱把品牌「植入」AI 答案,甲方怎么自己验收里写过一套完整协议,可以直接作为验收条款的操作附件。
关于「留一组不给乙方的对照提问」:从提问集里留出 20%–30% 不写进给乙方的清单,但甲方照常监测。这一条既是验收工具也是谈判筹码——投放词与对照词一起涨,说明涨的是行业热度而非这笔钱的效果。若采购的是代运营服务,建议把它写成甲方权利条款而非双方共同执行项。
四、五条最容易被写进合同的危险条款
| 危险条款 | 为什么危险 | 改成 |
|---|---|---|
| 「保证品牌进入 AI 推荐前三 / 首位」 | 承诺对象不存在;国内主流 AI 引擎的对话答案里不存在可购买的固定推荐位(边界拆解) | 过程量承诺:引擎数、提问集规模、采样次数、复测频率、交付物 |
| 「监测准确率不低于 99.5%」 | 直接抄了乙方自宣数字,而它的分母与验证方法不在你手里,验收时无法执行 | 表 B 的「口径可复现」条:抽 10 条、甲方自测、约定容差 |
| 「覆盖 12+ 主流 AI 平台」 | 不点名无法核对;且覆盖数 ≠ 你的套餐里能跑几个 | 逐个点名 + 逐引擎写取数面 + 写明套餐内实际可用数 |
| 「乙方对监测数据享有所有权 / 可用于产品优化」 | 换供应商时历史数据带不走,趋势线断档;数据再利用范围不清 | 数据归甲方;终止后 X 天完整导出窗口;乙方留存与再利用范围明确列举 |
| 「效果不达标全额退款」 | 听起来对甲方有利,实际会倒逼对方用你验证不了的口径宣布达标 | 分级验收 + 分期付款:交付验收与口径验收挂钩付款,效果作为续约依据 |
另外提示一处合规边界(不构成法律意见):如果供应商的方案里包含批量生成未经核实的内容、虚构测评或伪造身份,责任并不只在乙方。我们在付费植入的验收那篇里核过相关法规状态与已公开的案例——采购文件里建议加一条内容真实性与合规承诺,要求乙方保证所产出内容不含虚假评价、不伪造主体身份,并承担由此产生的责任。
五、起草顺序:先定口径,再谈价
按这个顺序推进,法务和采购的返工最少:
- 先跑一轮基线(自己跑,或用工具跑)。没有基线,需求书里的所有目标值都是拍脑袋,验收时也没有对照。国内引擎的基线怎么跑,见如何监测品牌在国内 AI 搜索里的可见度。
- 定提问集,作为附件一。这是整份采购文件里唯一需要业务方深度参与的部分。
- 填表 A 的 9 组参数,作为附件二(技术参数)。此时才具备发比价单的条件——同一张表发给三家,回来的报价才可比。
- 把表 B 写进合同,作为附件三(履约验收方案)。
- 目标值最后定。有了基线和口径,「三个月提及率从 X 到 Y」才有意义。行业里流传的那组「三个月 15–25%、半年 30–50% 算健康」的基准数字在没有分母的前提下不能直接抄进合同——为什么不能抄、该怎么定自己的基准,见提及率 18% 算高还是低。
一个反直觉但省钱的建议:表 A 发出去之后,比价的重点不是谁的数字好看,是谁能把这张表填满。填不满的那几行,就是你未来验收时争执的位置。
供应商筛选侧的红旗清单(8 个危险信号、该拒收哪些虚荣指标),与本文互补的是GEO 服务商怎么选、怎么验收——那篇管「选谁」,这篇管「文件怎么写」。
常见问题(FAQ)
GEO 监测的采购需求书里,最不能省的是哪几条? 四条:① 引擎逐个点名,并写明每个引擎的取数面是 API、网页还是手机 App;② 提问集的规模、构成与变更控制;③ 每条提问每周期的采样次数与会话状态(是否新开会话、是否固定联网);④ 提及率等核心指标的分子分母写法。这四条决定了你收到的所有数字是否可比、可复核。其余条款写得再细,这四条空着,验收时就没有任何客观标准可援引。
为什么不能在合同里写「保证品牌进 AI 推荐前三」? 因为它承诺的对象不存在。AI 对话答案是每次生成的,同一条提问在不同会话、不同联网状态下结果都会变,主流国内 AI 引擎的对话答案里也不存在可购买的固定推荐位。把一个没有槽位的东西写成交付标准,结果只有两种:要么对方用你验证不了的口径宣布达标,要么这条根本无法执行。可以写进合同的是过程量与可复核的测量口径,不是结果排序。
GEO 监测有国家标准或行业标准可以援引吗? 截至 2026 年 8 月,我们未检索到针对「AI 可见度监测」的强制性国家标准或行业标准。这在采购上有直接后果:《民法典》第五百一十一条规定质量要求不明确时依次按强制性国标、推荐性国标、行业标准履行——而 GEO 监测这三级都取不到,最后只能落到「符合合同目的的特定标准」,也就是回到双方各说各话。所以口径必须自己写进合同附件,没有外部标准兜底。
验收标准怎么写才算「客观、量化」? 写成可以被第三方重跑的形式。不写「监测准确」,而写「甲方随机抽取提问集中 10 条,按合同附件约定的引擎、取数面、会话状态与采样次数自行复测,单条提及判定与乙方报告不一致的条数不超过 N 条」。财库〔2021〕22 号第二十四条对履约验收方案的要求就是这个思路:验收标准要包括所有客观、量化指标,涉及主观判断的要转化为客观量化标准。GEO 的特殊之处在于指标本身有统计波动,所以还要在条款里写明容差带与判定方法。
买工具(SaaS)和买代运营服务,需求书写法有什么不同? 表 A 的前八组参数通用,差异在后半段。买工具要额外写席位与工作区数量、多品牌/多市场的数据隔离、原始记录导出格式、终止后的导出窗口、配额用尽后的行为;买服务要额外写开工前基线报告、交付物清单(被引来源 URL 明细是必交项而非附赠)、报告交付日、甲方第三方复测权。两者都要写变更控制——口径一改,历史数据就断档。
服务商说他们的口径和第三方工具不同,所以数字对不上,验收时该怎么处理? 口径不同确实会让数字对不上,但那是签约时该钉死的事,不是验收时的解释。在合同附件里把四件事写死:提及率的分子分母(提问条数 × 采样次数 × 引擎数)、每个引擎的取数面、账号是否登录、是否固定开启联网检索。四项定死后,双方数字应当落在同一量级;仍有系统性偏差的,按抽检复现条款现场对跑一轮,以附件口径为准。拒绝把口径写进附件的,验收从一开始就不成立。
想在发需求书之前先给自己拉一条基线?闻响 GeoEcho 能同时测你在国内(豆包 / DeepSeek / Kimi / 元宝 / 通义 / 百度 AI)与海外(ChatGPT / Perplexity / Gemini) 引擎里的提及率、推荐率与引用来源——输入域名,30 秒出一份免费快照,不用约销售、不用先签合同。拿这份快照去填表 A 的目标值,比对着供应商的方案书填靠谱得多。
[NEEDS DATA —— 人工核实:GeoEcho 自身在表 A 第 8、9 组参数上的真实能力状态(原始记录导出格式与字段、多工作区/多品牌隔离、终止后导出窗口天数)。核实后可在此处补一段「我们自己这张表怎么填」,未核实前不要写。]
参考来源
常见问题
GEO 监测的采购需求书里,最不能省的是哪几条?
四条:① 引擎逐个点名,并写明每个引擎的取数面是 API、网页还是手机 App;② 提问集的规模、构成与变更控制(改了提问集,前后两期数字就不可比);③ 每条提问每周期的采样次数与会话状态(是否新开会话、是否固定联网);④ 提及率等核心指标的分子分母写法。这四条决定了你收到的所有数字是否可比、可复核。其余条款写得再细,这四条空着,验收时就没有任何客观标准可援引。
为什么不能在合同里写「保证品牌进 AI 推荐前三」?
因为它承诺的对象不存在。AI 对话答案是每次生成的,同一条提问在不同会话、不同联网状态下结果都会变,主流国内 AI 引擎的对话答案里也不存在可购买的固定推荐位。把一个没有槽位的东西写成交付标准,结果是两种:要么对方用你验证不了的口径宣布达标,要么这条根本无法执行。可以写进合同的是过程量(覆盖引擎数、提问集规模、采样次数、复测频率、交付物形式)和可复核的测量口径,不是结果排序。
GEO 监测有国家标准或行业标准可以援引吗?
截至 2026 年 8 月,我们未检索到针对「AI 可见度监测」的强制性国家标准或行业标准。这一点在采购上有直接后果:《民法典》第五百一十一条规定,质量要求约定不明确时依次按强制性国标、推荐性国标、行业标准履行——而 GEO 监测这三级都取不到,最后只能落到「符合合同目的的特定标准」,也就是回到双方各说各话。所以口径必须自己写进合同附件,没有外部标准兜底。
验收标准怎么写才算「客观、量化」?
把每一项都写成可以被第三方重跑的形式。例如不写「监测准确」,而写「甲方随机抽取提问集中 10 条,按合同附件约定的引擎、取数面、会话状态与采样次数自行复测,单条提及判定与乙方报告不一致的条数不超过 N 条」。财政部《政府采购需求管理办法》第二十四条对履约验收方案的要求就是这个思路:验收标准要包括所有客观、量化指标,涉及主观判断的要转化成客观量化标准。GEO 的特殊之处在于,指标本身有统计波动,所以还要在条款里写明容差带和判定方法。
买工具(SaaS)和买代运营服务,需求书写法有什么不同?
参数表的前半段(引擎与取数面、提问集、采样、指标定义、数据导出)两者通用,后半段不同。买工具要额外写:席位与工作区数量、多品牌/多市场怎么隔离、原始记录导出格式、账号与历史数据在终止后的导出窗口、配额用尽后的行为。买服务要额外写:交付物清单(含被引来源 URL 明细是必交项而非附赠)、报告交付日、甲方第三方复测权、基线报告在开工前完成。两者都要写变更控制——口径一改,历史数据就断档。
服务商说他们的口径和第三方工具不同,所以数字对不上,验收时该怎么处理?
口径不同确实会让数字对不上,但那是签约时该钉死的事,不是验收时的解释。可执行的做法是在合同附件里把四件事写死:提及率的分子分母(提问条数 × 采样次数 × 引擎数)、每个引擎的取数面、账号是否登录、是否固定开启联网检索。四项定死后,双方数字应当落在同一量级;仍有系统性偏差的,按抽检复现条款现场对跑一轮,以附件口径为准。拒绝把口径写进附件的,验收从一开始就不成立。