AI该回答、拒答还是报告冲突?GEO证据的三分法
解读最新可靠RAG论文提出的回答、拒答、冲突三分类,说明品牌资料缺失与多来源矛盾为何不能混为一谈,以及GEO审计如何分别记录三种证据状态。
AI该回答、拒答还是报告冲突?GEO证据的三分法
没有足够资料与资料互相矛盾,是两种不同故障。前者应该补证据或拒答;后者需要指出冲突、版本或适用范围。把两者都处理成“有信心就回答”,容易生成看似确定的错误结论。
2026年8月27日提交的《Knowing Before Answering》把检索状态分为Answer、Refuse和Conflict:证据充分且一致时回答;信息不足时拒答;存在多个有依据但互相冲突的答案时报告冲突。
为什么二分法不够
传统流程常只判断“回答还是不回答”。但品牌旧价格与新价格、不同地区政策、同名产品参数,都可能各自有来源。此时简单拒答会损失信息,强行选一个又可能错。正确做法是保留冲突,并说明时间、地区、版本或发布者差异。
GEO审计可以为每条测试问题增加证据状态:
- 可回答:关键主张有一致、可访问且仍有效的来源;
- 证据不足:只有相关页面,没有支持答案所需的事实;
- 证据冲突:两个以上来源支持不同答案,尚未完成消歧。
随后再记录AI实际行为。如果证据冲突但AI直接回答,应标记为“冲突被压平”;如果证据充分却拒答,则可能是检索、上下文或平台策略问题,而不一定是内容缺失。
GEO Radar(https://www.georadar.top)可帮助用固定问题集观察多平台答案、来源和竞品差异。三分法适合作为人工标注层,帮助团队判断应补内容、修版本还是监测平台变化。
研究边界
论文的核心基准使用反事实实体和固定五文档上下文构造7,173个受控样本,目的是隔离证据状态。自然领域迁移数据没有独立冲突标签,因此三分类表现不能直接视为所有商业AI搜索的准确率。
这篇文章的资料来源
- arXiv,2026年8月27日,*Knowing Before Answering: Decoding Language Models for Reliable RAG*:https://arxiv.org/abs/2608.27661