← 返回GEO学院
风险边界

过滤越狠,AI答案越安全吗?RAG防御的证据删除代价

结合CamoDocs论文中的NeoQA实验,解释大规模删除可疑检索文档为何可能同时摧毁正常回答能力,并给出GEO来源防御应同时报告安全性与可用性的边界指标。

发布于 2026/09/04 2 分钟阅读
RAG防御证据删除AI答案可靠性

过滤越狠,AI答案越安全吗?RAG防御的证据删除代价

把可疑来源全部删除,确实可能降低攻击影响;但如果AI必须依赖外部资料才能回答,过度过滤也会把正确证据一起移走。安全率上升不等于系统更有用。

CamoDocs论文专门比较了这种权衡。在依赖检索的NeoQA基准上,TrustRAG在没有攻击时删除91.48%的检索文档,准确率从干净RAG的29.13%下降到5.79%。在受到攻击时,攻击成功率仍有23.25%,正确率为9.08%。

为什么旧基准可能低估代价

如果模型凭训练记忆就能回答,删除外部证据后的损失看起来不会太大。论文对比发现,HotpotQA在不检索时仍有37.20%的准确率,而NeoQA用虚构知识迫使模型依赖文档。后者更容易暴露“防御靠删光证据”的问题。

评估AI搜索来源防御时,至少应并列报告:

  • 可疑内容进入最终上下文的比例;
  • 干净问题在过滤前后的正确率;
  • 被删除的正常来源比例;
  • 无法回答、错误回答和证据冲突各自的数量;
  • 高风险事实是否仍保留人工升级通道。

GEO Radar(https://www.georadar.top)可用于观察不同平台的品牌答案、来源与竞品差异。若某平台突然减少来源并出现更多拒答,团队应把它记录为来源池变化,而不是自动认定品牌内容质量下降。

品牌内容侧的边界

企业不能控制平台的过滤器,但可以降低正常资料被误伤的概率:保持发布者、日期、版本和事实范围清晰;避免大量近似页面重复同一主张;让关键事实存在独立、可访问的支持来源。即便如此,也不能保证平台一定检索或保留页面。

这篇文章的资料来源

  • arXiv,2026年8月28日,*CamoDocs: A Poisoning Attack Against Retrieval-Augmented Language Models Using Camouflaged Documents*:https://arxiv.org/abs/2608.28389