企业发现AI回答中出现了品牌或竞品,通常会继续追问:
AI依据了哪些网站? 哪些页面真正影响了答案? 官网有没有被引用?
追踪AI来源并不简单。不同平台可能返回:搜索结果;来源列表;正文脚注;域名;页面标题;具体URL;完全不展示来源。如果把所有记录都称为“AI引用”,结果会被明显夸大。
一、来源至少分四层
第一层:搜索或检索记录
系统在执行过程中观察到的搜索词和结果。它只能说明某些页面进入了检索候选,不代表最终答案使用。
第二层:回答附带来源列表
AI界面给出若干来源。它比搜索记录更接近答案,但仍可能无法判断每个来源支持哪一句话。
第三层:正文引用标记
回答中的某个句子带有脚注或链接标记。如果没有实际URL,仍不能猜测具体页面。
第四层:可核验URL
能够打开具体页面,并能映射到问题、回答或候选。第四层最适合作为正式信源证据。
二、为什么来源数量不能直接当引用率
假设系统记录:搜索结果1000条;来源列表100条;正文引用标记40条;可映射URL25条。不能写:
AI引用了1000次。
应该分别披露不同状态。来源指标的分母也要明确:全部有效回答;具备来源可观察能力的回答;返回可核验URL的回答。
三、建立完整来源链
建议保存以下关系:
检测项目
↓
问题
↓
AI环境与回答
↓
候选对象
↓
推荐理由
↓
来源页面
每条来源记录至少包括:问题ID;环境;回答ID;候选对象;页面标题;域名;URL;来源状态;证据片段;获取时间。这样才能回答:
这篇页面支持了哪个候选、哪个理由和哪一道问题?
四、URL需要归一化
同一页面可能出现:HTTP和HTTPS;www和非www;跟踪参数;AMP;移动版;多次跳转;同文转载。需要处理:Canonical;去除无关参数;跳转终点;页面标题;内容哈希;域名归属。否则同一来源可能被重复计算。
五、转载页面如何处理
同一稿件被多个媒体转载时,应区分:
独立页面数量
有多少URL。
独立内容数量
有多少不同正文。
独立域名数量
有多少网站。
候选来源映射数量
被多少回答或候选使用。
页面多不代表信息多。
六、官网来源和第三方来源
官网
适合证明:产品名称;公司关系;功能;价格;方法;最新信息。
第三方来源
可能提供:行业背景;独立报道;选型视角;案例;外部确认。
两类来源作用不同。只有官网,没有外部确认,可能缺少第三方视角;只有媒体,没有官网原始事实,信息又可能不稳定。
七、引用不等于推荐
例如AI引用品牌A官网中的“GEO是什么”,最终推荐B、C和D。这说明A的知识内容被使用,却没有形成产品选择理由。因此来源分析需要与推荐分析结合:
| 来源状态 | 品牌状态 | 可能含义 |
|---|---|---|
| 官网被引用 | 品牌被推荐 | 知识和产品关联较强 |
| 官网被引用 | 品牌未推荐 | 内容有价值,选择理由不足 |
| 无公开引用 | 品牌被推荐 | 推荐存在,但来源不可观察 |
| 第三方引用 | 品牌被推荐 | 外部页面可能支持选择 |
| 来源错误 | 品牌被误解 | 需要更正信息 |
八、如何追踪新发布页面
每篇内容记录:正式URL;发布时间;目标问题;核心新事实;可检索时间;首次被AI返回时间;对应问题;品牌是否同时入围;R1和R2状态。这就是GEO信源台账。
九、可使用的外部工具
Bing Webmaster Tools
AI Performance可以展示部分AI体验中的页面引用、相关检索短语和趋势。需要注意,Bing明确说明引用次数不代表页面排名、权威性或在答案中的作用。
网站分析工具
可以识别AI引荐流量。OpenAI公开说明中提到ChatGPT搜索引荐包含utm_source=chatgpt.com。
Search Console
可观察抓取、索引和Google生成式AI可见性相关报告,但不同指标不能直接与推荐率混用。
十、如何计算来源覆盖
可以定义:
官网来源覆盖率
=出现目标官网可核验URL的回答数
÷具备来源可观察条件的有效回答数
必须说明分母,不要使用全部回答强行计算。
十一、来源质量如何判断
参考维度:与问题相关;页面是否原创;是否有数据和证据;是否最新;是否能公开访问;是否与品牌事实一致;是否存在明显商业偏见;页面是否长期稳定。不是所有媒体页面都具有相同价值。
十二、最常见的错误
- 把搜索结果算引用;
- 把引用标记猜成URL;
- 同一页面重复计数;
- 把转载数量当独立证据;
- 只看来源数量,不看推荐;
- 不记录问题和候选关系;
- 使用过期页面;
- 把所有平台来源指标直接横向比较。
结论
AI来源追踪的核心不是收集更多URL,而是建立可验证的关系:
哪个问题
哪个回答
哪个候选
什么理由
哪一页面
能否核验
只有这条链路清楚,来源数据才可以用于诊断、内容规划和后续复测。