← GEO Academy로 돌아가기
비교 리뷰

페이지 관련성이 높으면 AI가 정말 사용한 걸까? GEO 귀속의 착시

최신 생성 검색 연구에서 BM25, 의미 유사도, 인과적 제거 프로브를 비교하고 관련 페이지를 실제 사용으로 오해하지 않는 GEO 귀속의 증거 단계를 제시합니다.

2026. 08. 28. 게시 3분 읽기
GEO 귀속근거 활용인과 프로브생성 검색

페이지 관련성이 높으면 AI가 정말 사용한 걸까? GEO 귀속의 착시

페이지가 질문과 답변에 의미상 가까워도 그 페이지가 생성 문구를 만들거나 뒷받침했다는 뜻은 아닙니다. 유사도는 사용 가능성을 보여 줄 뿐 실제 생성 의존성을 증명하지 않습니다. 유사도 점수를 콘텐츠 기여율로 쓰는 것은 GEO 보고서의 귀속 범위를 넘습니다.

2026년 8월 24일 공개된 *The Laws of Context Allocation*은 동일 쿼리 하드 네거티브를 만들었습니다. 질문 주제와 밀접하지만 목표 답변을 포함하거나 함의하지 않는 문서입니다. 다른 주제의 쉬운 방해 문서를 쓰면 BM25와 임베딩 지표의 AUC가 거의 1로 보였습니다. 동일 쿼리 하드 네거티브로 바꾸자 문서 3개 조건에서 BM25는 0.444, 질문–문서 코사인 유사도는 0.484로 떨어져 무작위 구분에 가까웠습니다.

논문의 삭제형 leave-one-out 프로브는 같은 조건에서 0.876, 문서 24개에서도 0.824였습니다. 이미 생성된 답변을 고정하고 컨텍스트 문서를 하나씩 뺀 뒤 동일 답변의 토큰별 가능도가 얼마나 내려가는지 측정합니다. 어떤 문서를 뺐을 때 실현된 답변이 뚜렷하게 생성되기 어려워진다면 의존성 증거가 더 강합니다.

세 가지 신호를 분리하기

검색 관련성은 문서가 질문에 맞는지, 표시 인용은 시스템이 출처로 보여 줬는지, 반사실 의존성은 해당 문서 없이 같은 답변이 유지되기 어려운지를 묻습니다. 세 신호는 일치할 수도 서로 갈릴 수도 있습니다.

자체 RAG라면 모델, 프롬프트, 생성된 답변을 고정한 채 문서를 제거하고 가능도나 핵심 주장 변화를 기록할 수 있습니다. 검증용 음성 예시에는 명백히 무관한 페이지만 두지 말고 같은 질문에 가까운 문서도 넣어야 합니다.

ChatGPT, Gemini, Perplexity 같은 폐쇄형 서비스에서 외부 브랜드는 전체 컨텍스트 풀이나 토큰 확률을 보통 볼 수 없습니다. 실무 보고서는 대신 증거 사다리를 사용하세요. 주제 유사성, 주장을 뒷받침하는 표시 인용, 반복 실행에서 안정적인 동시 등장, 그리고 통제 시스템에서 사전 정의한 제거 실험을 한 경우에만 조심스러운 인과 의존 표현 순서입니다.

중요 사실마다 질문, 전체 답변, 표시 출처, 페이지 버전, 수집 시각, 주장–출처 지지 관계, 실험 통제 정도를 보관하세요. “관련 가능성”, “인용 표시”, “주장 지지”, “제거 후 변화”를 별도 열로 두고 정밀해 보이는 영향 점수 하나로 합치지 마세요.

GEO Radar는 https://www.georadar.top 에서 브랜드 등장, 플랫폼 차이, 인용, 과거 답변을 관찰해 앞의 세 증거 단계를 기록할 수 있습니다. 감사 가능한 관찰 층일 뿐 유사성이나 동시 등장만으로 페이지가 답변을 유발했다고 증명하지 않습니다.

연구는 통제 RAG, 오픈 모델, 질의응답 벤치마크를 사용했습니다. 모든 상용 답변 엔진이 같은 컨텍스트 편성을 쓴다는 결론은 아닙니다. 즉시 적용할 가치는 더 어려운 음성 예시와 절제된 귀속 표현입니다.

이 글의 자료 출처