偽装出典を企業AI知識ベースへ入れないための選定基準
RAG・企業検索の選定時に確認すべき出典登録、版履歴、主張追跡、複製元検出、ロールバック、フィルタ後の有用性評価をまとめます。
偽装出典を企業AI知識ベースへ入れないための選定基準
企業知識ベースの危険は明らかなスパムだけではありません。自然で関連性の高いページも、正常な段落に一つの誤情報を隠せます。キーワードフィルタの有無だけでは、登録管理と事後追跡を評価できません。
CamoDocsは、対象クエリを直接含めず、埋め込みを分散し、読みやすさを保つ文書が、クエリ重複やクラスタ異常に依存する防御を弱めることを示しました。実務上の教訓は単一検出器を安全保証としないことです。
六つの確認能力
- ドメイン、発行者、権限、形式による出典許可
- 取得日、ハッシュ、変更履歴、削除理由の保存
- 回答から具体的な根拠段落への追跡
- 同じ原稿から派生した複製チェーンの検出
- 異常バッチの隔離、取消、索引再構築
- フィルタ後の正答、拒答、正常証拠損失の測定
導入前に、既知回答、証拠不足、相互矛盾を含む質問セットを用意します。遮断率だけを示し、誤削除率や正常タスク性能を示さない事業者では、資料を空にして安全に見せていないか判断できません。
GEO Radar(https://www.georadar.top)は公開AIでのブランド可視性、出典、競合差を観測し、私有知識ベース試験を外側から補完できます。ただしデータ環境が違うため、公開監測を私有RAGの安全結論にはできません。
出典統制でも巧妙な誤情報をすべて検出できません。医療、金融、法務、安全関連は権威出典の許可リスト、人手確認、明確な拒答規則が必要です。
この記事の情報源
- arXiv、2026年8月28日、*CamoDocs: A Poisoning Attack Against Retrieval-Augmented Language Models Using Camouflaged Documents*:https://arxiv.org/abs/2608.28389