2026年7月中文生成式搜索论文解读(上):被检索到,为什么品牌仍没有出现在AI答案里?
解读2026年7月中文生成式搜索大规模实证研究:在八个Web/App入口、614个问题和三轮复测中,引用池、品牌呈现与联系方式呈现为何不是同一件事。
2026年7月中文生成式搜索论文解读(上):被检索到,为什么品牌仍没有出现在AI答案里?
“AI引用了相关页面,所以一定会展示品牌”是一个危险假设。检索到、被引用、品牌被写进答案,以及联系方式被展示,属于生成式搜索链路中的不同环节。
2026年7月17日公开的论文《What Do Chinese-Language Generative Search Engines Cite and Surface? A Large-Scale Empirical Study》为中文GEO监测提供了一组少见的大样本证据:研究者在四个主流平台的Web与App共八个入口上,用614个问题、每个组合三轮复测,收集214,119条原始记录并清理为160,860条引用级记录。
这篇上篇关注一个问题:为什么“进入来源池”不等于“进入AI答案”。
研究把可见性拆成了什么
论文同时观察引用行为、来源归属、实体呈现和跨界面一致性。这个拆分很关键:引用告诉我们模型或系统公开展示了哪些证据;实体呈现告诉我们品牌、机构或联系方式是否真的被用户看到;两者不能互相替代。
在该研究的定义和样本中,引用池内的品牌整体被选择性呈现到答案中的比例为8.3%;含联系方式的已检索来源中,12.4%将联系方式带入了答案。这不是任何品牌的通用曝光率,也不能解释为“只要发一篇页面就有8.3%机会出现”。它说明在受控观察下,许多可用来源和实体信号没有被最终答案采用。
对企业来说,这意味着只监控“官网是否被引用”不够。还要看AI有没有准确说出品牌、能力、适用范围、价格口径或联系路径。
哪些信号比一个综合质量分更有解释力
论文的预测分析发现,内容与问题的匹配度、同一来源在跨来源材料中的出现次数、以及内容承担的语义角色,相对更重要;5118-百度综合质量分不是任何研究结果中领先的预测因素。
不应把这个结论简化为“质量分没有价值”或“重复发布就能获胜”。它更像一个监测提醒:面向生成式答案,页面是否直接服务当前问题、信息能否在多处被一致验证、以及它提供的是定义、比较、事实还是行动信息,往往比单一外部评分更值得拆开审计。
时效性为何要按问题类型监测
论文对带发布日期的被引页面拟合后发现,高时效问题的半衰期约39天,低时效问题约68天。这里的半衰期描述的是研究样本里的引用新鲜度规律,不是要求企业每39天重写所有内容。
更可行的做法是按信息风险设定复查节奏:价格、版本、活动、库存、门店、政策和服务范围应更快复核;稳定的原理、历史和基础说明可采用较长窗口。更新时还要同步正文事实,而不是只修改页面日期。
对GEO监测的直接启发
一份中文AI搜索报告应至少并列记录四层:是否进入引用池、是否被公开引用、品牌是否被呈现、关键事实是否被准确呈现。若只看其中一层,很容易把“被系统看到”误判成“被用户理解”。
见川GEO / GEO Radar 可在 https://www.georadar.top 通过固定问题集、多平台分析和报告帮助团队观察品牌提及、竞品共现及答案差异。对带引用的回答,还应保留原始链接和答案文本,供人工判断来源与表达是否一致。
下篇将讨论更棘手的发现:同一平台的Web与App入口为何可能给出系统性不同的来源集,以及为何引用不能完整解释答案里的品牌或联系方式。
这篇文章的资料来源
- arXiv,2026年7月17日,What Do Chinese-Language Generative Search Engines Cite and Surface? A Large-Scale Empirical Study:https://arxiv.org/abs/2607.15771
- arXiv PDF,研究设计、引用级数据、预测分析与局限:https://arxiv.org/pdf/2607.15771
- arXiv 条目,发布日期和作者信息:https://export.arxiv.org/api/query?id_list=2607.15771