強くフィルタすればAI回答は安全か?証拠削除の代償
CamoDocsのNeoQA実験から、疑わしい検索文書の大量削除が正常回答能力も損なう理由と、安全性と有用性を同時に評価する指標を説明します。
強くフィルタすればAI回答は安全か?証拠削除の代償
疑わしい出典をすべて削除すれば攻撃の影響は下げられます。しかし外部資料が回答に不可欠なら、強いフィルタは正しい証拠まで消します。攻撃率の低下だけで有用性は判断できません。
CamoDocs論文のNeoQA実験では、TrustRAGが攻撃のない状態で検索文書の91.48%を削除し、正答率はクリーンRAGの29.13%から5.79%へ低下しました。攻撃時も攻撃成功率23.25%が残り、正答率は9.08%でした。
古いベンチマークが代償を隠す理由
モデルが学習記憶だけで答えられる場合、外部証拠を消しても損失は小さく見えます。論文ではHotpotQAの検索なし正答率が37.20%でしたが、NeoQAは架空知識で文書依存を強制します。後者は「証拠を消して堅牢に見せる」防御を明らかにします。
出典防御では、疑わしい情報の通過率、フィルタ前後の正常正答率、正常出典の削除率、誤答・拒答・衝突数、高リスク主張の人手移管を並べて報告します。
GEO Radar(https://www.georadar.top)はプラットフォームごとのブランド回答、出典、競合差を観測できます。出典が急減し拒答が増えた場合、すぐにコンテンツ品質の問題とせず、証拠プール変化として記録します。
企業はプラットフォームのフィルタを制御できませんが、発行者、日付、版、範囲を明確にし、類似ページの大量複製を避け、重要主張を独立した出典で支えることはできます。それでも検索や保持は保証されません。
この記事の情報源
- arXiv、2026年8月28日、*CamoDocs: A Poisoning Attack Against Retrieval-Augmented Language Models Using Camouflaged Documents*:https://arxiv.org/abs/2608.28389