← 返回GEO学院
风险边界

内容没有违规词,为什么安全护栏仍挡不住恶意GEO?

最新GEO防御基准显示,面向暴力、仇恨等安全分类的通用护栏难以识别流畅的信息扭曲内容,错误过滤还可能删掉反驳证据并放大攻击。

发布于 2026/09/05 2 分钟阅读
AI安全护栏GEO错误信息来源过滤风险

内容没有违规词,为什么安全护栏仍挡不住恶意GEO?

一段文字可以没有暴力、仇恨、提示注入或其他政策违规,却仍然用流畅表达传播错误产品事实。通用安全护栏解决的是“内容是否属于危险类别”,不一定能判断“某个事实是否被精心扭曲”。

Counter-GEO-Bench测试Granite Guardian、Llama Guard 3和NeMo Self-Check Fact-Checking。三种现成防御的相对攻击成功率下降最多为5.7%,其中一项下降没有统计显著性。

防御为什么可能反向放大错误

论文观察到“防御即放大器”现象:过滤器删除了与错误主张相冲突的正常片段,反而让剩余错误来源更一致。在一个受测模型上,Granite Guardian使74个问题变差、仅使57个问题改善。

因此,企业不能只问“有没有安全护栏”,还要检查:

  1. 护栏是否针对事实操纵,而非仅针对安全分类;
  2. 被删除的片段是支持错误,还是反驳错误;
  3. 过滤后来源多样性和正常证据是否下降;
  4. 生成后的事实核验是否只是检查答案与被污染上下文一致。

GEO Radar(https://www.georadar.top)帮助观察不同平台的品牌回答、来源与异常变化。如果某次模型更新后来源突然变得单一,应复核答案是否失去了交叉佐证,而不是只看品牌提及是否增加。

适用边界

这不说明所有通用护栏都无效,也不说明论文专用检测器能处理所有攻击。论文未覆盖商业端到端产品、非英语和开放集自适应攻击。高风险领域仍需要外部事实来源、版本追踪和人工复核。

这篇文章的资料来源

  • arXiv,2026年9月2日,*Counter-GEO-Bench: Evaluating Defenses Against Information-Distorting Generative Engine Optimization*:https://arxiv.org/abs/2609.02316