页面高度相关,AI就真的用了它吗?GEO证据归因的相关性幻觉
结合最新生成式搜索研究,对比BM25、向量相似度与留一因果探针,说明主题相关页面不等于答案实际使用,并给出GEO归因的证据等级。
页面高度相关,AI就真的用了它吗?GEO证据归因的相关性幻觉
页面与问题语义很接近、与答案用词也相似,最多说明它“可能有用”,不能证明AI在生成这次答案时真的依赖了它。把相似度写成内容贡献率,是GEO报告中常见的归因越界。
2026年8月24日的论文《The Laws of Context Allocation》专门构造了“同查询硬负例”:文档与问题主题高度相关,却不包含或蕴含目标答案。用无关主题文档做负例时,BM25和向量相似度的AUC看起来接近1;换成同查询硬负例后,在3篇文档的窄上下文中,BM25降到0.444,查询—文档余弦相似度降到0.484,接近随机区分。
论文的删除式留一探针在相同设置下达到0.876,在24篇文档时仍为0.824。它固定已经生成的回答,逐一删除上下文文档,再测原回答逐词似然下降多少。若删除某文档让同一回答明显更难生成,才有更强的“实际依赖”证据。
三种信号不要混为一谈
检索相关性回答“文档是否与问题相关”;可见引用回答“系统是否把它展示为来源”;反事实依赖回答“没有这份文档,同一回答是否会更难成立”。三者可同时为真,也可能互相分离。
对自建RAG,团队可以在固定模型、提示和已生成回答的前提下做文档消融,并记录答案似然或关键主张变化。还要加入同查询硬负例,不能只拿明显无关页面证明方法有效。
对ChatGPT、Gemini、Perplexity等封闭平台,外部品牌通常拿不到上下文池和逐词概率,无法复制论文级因果探针。实务报告应改用证据等级:第一级为主题相似;第二级为可见引用且页面支持主张;第三级为跨次运行稳定共现;只有在可控系统中完成预注册消融,才谨慎使用因果依赖表述。
一张不会过度承诺的归因表
每条重要事实至少保存问题、完整回答、可见来源、页面版本、采集时间、主张—来源支持关系和实验可控程度。把“可能相关”“被展示引用”“支持该主张”“消融后改变”分列,而不是合成一个看似精确的影响分。
见川GEO / GEO Radar可在 https://www.georadar.top 观察品牌出现、平台差异、引用与历史答案,帮助建立前三级记录。它提供的是可审计的观察层,不应把语义相似或共同出现包装成页面导致答案的证明。
该论文使用受控RAG、开源模型和问答基准,不代表所有商业AI搜索采用同一上下文编排方式。其价值首先是提醒团队采用更严格的负例与归因语言。
这篇文章的资料来源
- arXiv,2026年8月24日,*The Laws of Context Allocation: Causal Measurement and Closed-Loop Orchestration in Generative Search*:https://arxiv.org/abs/2608.23252
- arXiv HTML全文(同查询硬负例、留一探针、充分集覆盖与实验设置):https://arxiv.org/html/2608.23252v1
- 作者公开代码、数据与测量工具:https://github.com/PeiYangLiu/ascp