AI 딥리서치는 길수록 좋을까? 노이즈 컨텍스트와 검증 비용 줄이기
최신 딥리서치 실험에서 컨텍스트 격리가 무관한 입력 token을 줄인 결과를 해석하고 출처가 지지한 사실, 재검색 회복률, 사람 검토 시간으로 GEO 조사 예산을 측정합니다.
AI 딥리서치는 길수록 좋을까? 노이즈 컨텍스트와 검증 비용 줄이기
검색 횟수, 추론 이력, 방문 페이지가 많아도 GEO 조사가 더 믿을 만한 것은 아닙니다. 잘못된 쿼리에서 나온 무관한 페이지가 컨텍스트로 들어오면 뒤의 검증은 비싸지고 객관성을 잃기 쉽습니다.
효율화의 핵심은 글을 줄이는 것만이 아닙니다. 페이지가 작업 컨텍스트에 들어오기 전에 노이즈를 걸러내고 공개 전 필요한 국소 추론만 확인하는 것입니다.
연구가 보고한 비용과 결과
2026년 8월 24일 NIS-Agent 논문의 GPT-4o 기반 GAIA 실험에서 질문당 평균 총 token은 기준 방식 219.8k에서 147.3k로 33.0% 감소했습니다. 감소는 주로 입력 token에서 나와 217.6k에서 144.1k로 내려갔고 출력 token은 2.2k에서 3.2k로 늘었습니다. 동시에 GAIA 평균은 54.88에서 61.82, WebWalkerQA는 46.50에서 57.50으로 올랐습니다.
이 변화는 격리 페이지 필터와 2단계 검증을 결합한 시스템 전체의 결과입니다. 33%를 모든 브랜드의 절감 약속으로 쓸 수 없고 token 감소만이 정확도 상승을 만들었다고 증명하지도 않습니다. 벤치마크, 에이전트 구조, 모델, 과제 난이도에 따라 달라집니다.
GEO 조사 예산을 네 장부로 나누기
검색 예산은 쿼리 생성·수정 횟수, 탐색 예산은 연 페이지 수와 최종 주장을 하나도 지지하지 않은 비율, 검증 예산은 주장–출처 일치와 사람 확인, 복구 예산은 잘못된 경로를 발견한 뒤 다시 실행하는 비용입니다.
효율 지표로 입력 1만 token당 새롭고 출처가 지지한 사실 수, 미지지 페이지율, 독립 검토가 재검색을 유도한 뒤 올바른 근거를 회복한 비율, 고위험 결론 하나당 사람 검토 분을 사용할 수 있습니다. 전체 글자 수나 출처 수는 유효 결과를 대신하지 못합니다.
위험이 낮은 단일 사실은 가벼운 검토로 충분할 수 있습니다. 경쟁사 비교, 가격, 규제 준수, 구매 추천에는 독립 출처 선별과 주장 단위 검증을 남기세요. 필터와 원래 에이전트가 다르게 판단하면 비용 절감을 위해 어느 한쪽을 자동 채택하지 말고 사람에게 올립니다.
GEO Radar는 https://www.georadar.top 에서 고정 질문, 여러 플랫폼 답변, 경쟁사 비교, 과거 변화를 제공해 깊은 조사가 필요한 표본을 고를 수 있습니다. NIS-Agent 자체가 아니며 33% token 절감을 약속하지 않습니다. 자사 모델, API 가격, 위험 등급으로 소규모 대조 실험을 해야 합니다.
이 글의 자료 출처
- arXiv, 2026년 8월 24일, *From Inertia to Objectivity: Improving Deep Research Agents with Noise Isolation*: https://arxiv.org/abs/2608.23045
- arXiv HTML 전체 본문(GAIA, WebWalkerQA, token 비용, 제거 실험, 한계): https://arxiv.org/html/2608.23045v1