違反表現のない悪意あるGEOを一般安全ガードが見逃す理由
最新GEO防御研究から、安全分類ガードが流暢な事実歪曲を見逃し、反証する正常証拠の削除によって攻撃を強める可能性を説明します。
違反表現のない悪意あるGEOを一般安全ガードが見逃す理由
暴力、憎悪、プロンプト注入がなくても、流暢な文章で誤った商品事実を広められます。一般ガードは危険分類を判定しますが、個別事実の戦略的歪曲を判断できるとは限りません。
Counter-GEO-BenchでGranite Guardian、Llama Guard 3、NeMo Self-Checkを評価した結果、既製防御の相対攻撃成功率低下は最大5.7%で、一つは統計的に有意ではありませんでした。
防御が誤りを強める場合
フィルタが誤主張を反証する正常断片を削除し、操作出典を相対的に強くする「防御による増幅」が観測されました。一つのモデルでGranite Guardianは74問を悪化させ、改善は57問でした。
防御が事実操作用か安全分類用か、削除断片が誤りを支持・反証したか、出典多様性と正常証拠が減ったか、生成後確認が汚染文脈との整合だけを見ていないかを調べます。
GEO Radar(https://www.georadar.top)はプラットフォーム間のブランド回答と出典変化を観測できます。更新後に出典が単一化したら、言及増加だけでなく相互検証の消失を確認します。
論文は商用エンドツーエンド製品、多言語、適応的オープンセット攻撃を扱いません。高リスク領域には外部権威資料、版管理、人手確認が必要です。
この記事の情報源
- arXiv、2026年9月2日、*Counter-GEO-Bench: Evaluating Defenses Against Information-Distorting Generative Engine Optimization*:https://arxiv.org/abs/2609.02316