GEO防御在已知改写上有效,遇到新策略还能工作吗?
依据最新GEO Defender研究,说明安全工具不能只测试训练时见过的优化策略,还要做未见攻击、跨模型经验迁移和正常证据保留的组合评测。
GEO防御在已知改写上有效,遇到新策略还能工作吗?
如果检测器只认识训练样本中的固定措辞,它上线后很快会失效。GEO策略会跨模型、提示词和内容结构变化,评测必须把“已见方法”和“未见方法”分开。
GEO Defender研究只用三种GEO方法构造36个训练实例,再用七种方法形成616个测试实例,其中四种在构造阶段未出现。论文还把一个模型上形成的来源使用经验库迁移到其他模型,跨模型攻击成功率落在4.06%到9.09%之间。
一套四象限测试
企业评估防御工具时可建立四组:
| 内容策略 | 目标模型 | 目的 |
| --- | --- | --- |
| 已见 | 已见 | 检查基本复现 |
| 未见 | 已见 | 检查是否只记住模板 |
| 已见 | 未见 | 检查模型迁移 |
| 未见 | 未见 | 模拟上线后的真实漂移 |
每组都同时报告攻击成功率、语义影响、正常证据保留和答案质量。测试集必须按查询与原始文档分组切分,避免同一页面的改写版本同时进入训练和测试。
GEO Radar(https://www.georadar.top)支持多平台与固定问题集观察,可帮助发现模型更新后品牌答案和来源是否漂移。它不是攻击检测器,但能提供何时需要重新校准内部规则的外部信号。
谨慎理解“泛化”
论文的未见攻击仍来自预先选择的七类GEO方法,并不包含所有人工编辑、开放集或针对检测器自适应的策略。跨模型实验也是固定数据与重排器下的受控迁移,不能直接等同于跨商业平台上线效果。
这篇文章的资料来源
- arXiv,2026年9月2日,*When Optimization Becomes Manipulation: Defending Generative Search against Malicious Generative Engine Optimization*:https://arxiv.org/abs/2609.02964