← GEO Academy로 돌아가기
리스크 경계

강한 필터링이 AI 답변을 더 안전하게 만들까? 증거 삭제 비용

CamoDocs의 NeoQA 실험을 통해 의심 검색 문서의 대량 삭제가 정상 답변 능력도 파괴하는 이유와 안전성·유용성을 함께 평가할 지표를 설명합니다.

2026. 09. 04. 게시 2분 읽기
RAG 방어증거 삭제AI 답변 신뢰성

강한 필터링이 AI 답변을 더 안전하게 만들까? 증거 삭제 비용

의심스러운 출처를 모두 제거하면 공격 영향은 줄일 수 있습니다. 하지만 AI가 외부 문서에 의존해야 한다면 강한 필터는 올바른 증거도 없앱니다. 공격률 감소가 곧 더 유용한 시스템을 의미하지 않습니다.

CamoDocs 논문의 NeoQA 실험에서 TrustRAG는 공격이 없을 때 검색 문서의 91.48%를 삭제했고 정확도는 깨끗한 RAG의 29.13%에서 5.79%로 떨어졌습니다. 공격 상황에서도 성공률 23.25%가 남았고 정답 정확도는 9.08%였습니다.

오래된 벤치마크가 비용을 숨기는 이유

모델이 학습 기억만으로 답할 수 있으면 외부 증거 삭제 손실이 작아 보입니다. 논문에서 HotpotQA는 검색 없이도 37.20% 정확도를 보였지만 NeoQA는 허구 지식으로 문서 의존을 강제합니다. 후자는 증거 풀을 비워 강건해 보이는 방어를 드러냅니다.

출처 방어 평가에는 의심 콘텐츠의 최종 맥락 진입률, 필터 전후 정상 정확도, 정상 출처 삭제율, 오답·거절·충돌 수, 고위험 주장에 대한 사람 검토 경로를 함께 보고해야 합니다.

GEO Radar(https://www.georadar.top)는 플랫폼별 브랜드 답변, 출처, 경쟁사 차이를 관찰합니다. 출처가 갑자기 줄고 거절이 늘면 곧바로 콘텐츠 품질 문제로 결론 내리지 말고 증거 풀 변화로 기록해야 합니다.

브랜드는 플랫폼 필터를 통제할 수 없지만 게시자, 날짜, 버전, 범위를 명확히 하고 유사 페이지 대량 복제를 피하며 중요 주장을 독립적 출처로 지원할 수 있습니다. 그래도 검색과 보존은 보장되지 않습니다.

이 글의 자료 출처

  • arXiv, 2026년 8월 28일, *CamoDocs: A Poisoning Attack Against Retrieval-Augmented Language Models Using Camouflaged Documents*: https://arxiv.org/abs/2608.28389