GEO优化完成后,很多企业会立即打开一个AI工具,再问一次原来的问题。
如果品牌出现了,就认为优化成功;如果没有出现,就认为内容无效。
这种判断最大的问题是:
第二次提问是否仍然与优化前处于同一测量条件,往往没有被检查。
GEO复测最重要的原则不是“再测一次”,而是:
先确认哪些条件没有变,再判断哪些结果发生了变化。
一、什么叫同口径复测
一次可比复测,至少需要核对以下条件:
| 条件 | 优化前与复测时应保持什么 |
|---|---|
| 检测对象 | 同一个品牌、产品或服务 |
| 对象层级 | 不把产品改成整家公司 |
| 推荐品类 | 候选集合保持一致 |
| 使用场景 | 地区、人群和需求条件可比 |
| 问题集合 | 使用同一套冻结问题 |
| 执行环境 | AI环境尽量相同或明确标记变化 |
| 实体规则 | 别名和归属规则不静默扩大 |
| 样本规则 | 有效回答和无效原因口径一致 |
| 指标方法 | 推荐、位置和来源定义不变 |
只要其中一项发生实质变化,前后数字就需要谨慎解释。
二、最常见的“伪提升”
换了更容易出现品牌的问题
优化前使用自然选型题,优化后直接问:
某品牌值得使用吗?
这种回答更接近品牌认知,不能与自然推荐率比较。
减少了不利问题
优化前30题,优化后只保留表现较好的10题,总体推荐率自然可能上升。
只保留表现最好的平台
优化前测多个环境,优化后只测一个已经出现品牌的平台,会掩盖其他平台没有变化的事实。
扩大别名规则
优化前只认正式产品名,优化后把宽泛简称也计入命中,数字变化可能来自识别规则,而不是AI认知变化。
三、复测前先检查页面是否可发现
内容发布到AI可能使用之间,通常存在四层:
页面已发布
↓
页面可公开访问
↓
页面可被检索或作为来源观察
↓
品牌进入AI候选或推荐
发布成功不等于AI已经能够使用。
复测前至少检查:
- 页面是否返回正常状态;
- 是否无需登录;
- 正文是否为可读取文本;
- 标题和URL是否稳定;
- Canonical是否正确;
- 是否进入站点地图;
- 完整标题或独特句子是否可检索;
- robots.txt是否阻止相关抓取;
- 产品名称和品类表达是否一致。
OpenAI面向发布者的说明指出,希望内容进入ChatGPT搜索摘要和引用结果的网站,不应阻止OAI-SearchBot访问。Google也持续强调抓取、索引、内容质量和基础SEO仍是生成式搜索功能的基础。
这些条件不能保证被引用,但能避免因为页面根本不可访问而误判内容方向。
四、建议使用R1和R2两次复测
R1:第一次变化观察
目的不是宣布成功,而是寻找首次可确认变化。
建议在核心页面具备基本可发现性后执行。
重点记录:
- 哪几道题首次出现品牌;
- 出现在哪些环境;
- 是否正确识别产品和所属公司;
- 是否进入候选还是仅被提及;
- 推荐理由是否与产品能力一致;
- 是否出现新增可核验来源。
R2:稳定性复测
目的在于确认R1是否能够复现。
如果R1出现3道题,R2全部消失,R1更可能属于弱信号。
如果R2保留2道,并扩展到更多平台,说明候选关联的稳定性更强。
可以增加一个辅助观察值:
复现率
=R1中出现且R2再次出现的问题数
÷R1出现的问题总数
这个值适合作为实验观察量,不应未经验证就包装成通用行业标准。
五、复测不应只看一个推荐率
建议同时观察:
| 指标 | 回答的问题 |
|---|---|
| 有效推荐率 | 进入候选的回答占比 |
| 首次入围题数 | 哪些问题从无到有 |
| 平台覆盖数 | 从一个环境扩展到几个 |
| 高位推荐 | 是否进入更靠前位置 |
| 最终决策 | 综合条件下是否仍被选择 |
| 品类准确性 | AI是否正确理解产品类别 |
| 推荐理由 | 是否形成具体匹配依据 |
| 竞品差距 | 自己和主要竞品是否同时变化 |
| 来源变化 | 是否出现新官网或媒体页面 |
| 有效样本 | 分母是否保持可比 |
| R2复现 | 变化是否能够再次观察 |
例如:
基线:0/177
R1:3/175
R2:5/176
不能只写“从0提升到2.8%”。
还要说明:
- 3条与5条分别来自哪些问题;
- 是否在同一平台;
- 是否有2条得到复现;
- 有效样本为什么不同;
- AI描述是否准确。
六、如何设计更有分析价值的题目分组
不修改原题的前提下,可以为复测建立三个观察组。
目标问题组
本轮内容直接回答的问题。
邻近问题组
与目标问题相关,但没有被直接覆盖。
观察对照组
与本轮行动关联较弱的问题。
如果变化主要集中在目标组,邻近组出现少量扩散,对照组基本稳定,说明变化与内容方向具有更强的关联性。
它仍不能单独证明因果,但比只看总分更有分析价值。
七、GEO行动登记表有什么用
同期发布多篇内容时,需要记录:
- 内容编号;
- 目标问题;
- 对应基线题目;
- 发布平台和URL;
- 发布时间;
- 核心新增事实;
- 首次可检索时间;
- 是否出现在AI来源中;
- R1和R2结果。
这样才能逐渐回答:
- 哪类问题稿更容易形成来源;
- 官网页还是外部页先被观察到;
- 哪些文章虽然发布,却没有进入可发现状态;
- 哪些题目最先出现产品。
不能据此断言某一篇文章单独造成变化,但能为下一轮资源分配提供依据。
八、什么时候不能直接比较
以下情况应标记为新的检测版本,而不是直接与原基线比较:
- 推荐品类改变;
- 市场和地区改变;
- 题目文本大幅调整;
- 主要AI环境更换;
- 实体识别规则升级;
- 推荐判定逻辑改变;
- 有效样本门槛改变;
- 报告指标重新定义。
AI心智指数当前方法分别保存范围、题库、方法、指标和报告快照,其目的就是保留历史结果并支持可比复测,而不是使用新方法静默重算旧报告。
九、企业可以直接使用的复测清单
基线阶段
- [ ] 已冻结对象和场景
- [ ] 已保存题目原文
- [ ] 已保存各环境回答
- [ ] 已记录有效样本
- [ ] 已记录竞品和来源
- [ ] 已冻结方法版本
内容建设阶段
- [ ] 每项动作对应明确问题
- [ ] 已保存正式URL和发布时间
- [ ] 页面名称与产品事实一致
- [ ] 已检查公开访问和可检索性
- [ ] 未批量复制近似页面
R1阶段
- [ ] 没有更换题库
- [ ] 没有扩大品牌别名
- [ ] 分别记录提及、候选和推荐
- [ ] 保存首次出现的原始回答
- [ ] 核验新增来源URL
R2阶段
- [ ] 检查R1变化是否复现
- [ ] 检查是否扩展到更多平台
- [ ] 检查是否进入最终决策
- [ ] 检查推荐理由是否准确
- [ ] 未把单次变化写成确定因果
结论
GEO复测不是“发稿后再问一次”,而是一项版本化的前后观察。
正确顺序是:
建立冻结基线
↓
登记内容和信源动作
↓
检查页面可发现性
↓
R1寻找首次变化
↓
R2验证是否复现
↓
继续优化最重要的缺口
真正值得企业关注的,不是一次回答突然出现品牌,而是品牌能否在相同或可比问题中,被多个环境或多轮检测持续、准确地列入候选。