← GEO Academy로 돌아가기
실무 가이드

GEO: Generative Engine Optimization 논문 읽기 (2): GEO-bench와 콘텐츠 개선 실험

KDD 2024 논문 GEO: Generative Engine Optimization의 GEO-bench, 9가지 콘텐츠 개선 방법, 실험 결과를 분석하고, AI 검색에서 키워드 반복의 한계를 설명합니다.

2026. 07. 25. 게시 5분 읽기
GEO 최적화 방법GEO-benchAI 검색 실험Generative Engine Optimization

GEO: Generative Engine Optimization 논문 읽기 (2): GEO-bench와 콘텐츠 개선 실험

첫 글에서 논문이 GEO를 정의한 방식을 살폈다면, 이번에는 실험을 봅니다. *GEO: Generative Engine Optimization*은 개념에 머물지 않고 대규모 벤치마크 GEO-bench를 만들고 다양한 콘텐츠 재작성 방법을 같은 평가 틀에서 비교했습니다. 이 덕분에 "AI가 무엇을 좋아할까"라는 감각적 논의를 어떤 변경이 어떤 지표에서 가시성을 높일 가능성이 있는지로 옮길 수 있습니다.

GEO-bench가 해결하려 한 문제

논문은 당시 생성형 엔진 전용 공개 질의 데이터셋이 없었다고 지적하며 GEO-bench를 구축했습니다. 이 벤치마크는 1만 개 질의로 이뤄졌고, 학습 8,000개·검증 1,000개·테스트 1,000개로 나뉩니다.

질의는 MS MARCO, ORCAS-1, Natural Questions, AllSouls, LIMA, Davinci-Debate, Perplexity.ai Discover, ELI5, GPT-4 생성 질의에서 왔습니다. 즉 전통 검색의 익명 실제 질의뿐 아니라 다중 출처 종합, 추론, 설명, 토론, 구매 판단이 필요한 문제도 포함합니다.

논문은 각 질의에 Google 검색 상위 5개 결과의 정제 텍스트를 붙여 생성형 엔진의 출처 입력을 모사했습니다. GEO는 최종 답변만이 아니라 AI가 사용할 수 있는 출처 재료를 함께 연구해야 한다는 뜻입니다.

논문이 비교한 아홉 가지 GEO 방법

저자들은 권위 있는 표현, 정량 통계 추가, 더 많은 질의 키워드 추가, 신뢰할 수 있는 출처 인용 추가, 신뢰할 수 있는 인용문 추가, 언어 단순화, 문장 유창성 향상, 독특한 용어 추가, 기술 용어 추가를 시험했습니다.

통계·출처 인용·인용문은 단순한 어조가 아니라 답변의 판단을 뒷받침할 재료를 늘리는 증거 강화 방식입니다. 단순화·유창성·권위·기술성은 모델이 내용을 이해하고 압축·재서술하기 쉬운지에 더 영향을 줍니다.

실험 결과를 과장 없이 읽는 법

GEO-bench에서 인용, 인용문, 통계는 가장 강한 방법들로 나타났습니다. Position-Adjusted Word Count에서 최선의 방법은 기준선 대비 최대 약 41% 상대 향상을 보였고, Subjective Impression에서는 최대 약 28%였습니다. 본문은 상위 방법이 지표에 따라 대체로 30~40%, 15~30%의 상대 개선을 냈다고 요약합니다.

이는 숫자 몇 개를 넣으면 항상 40% 오른다는 의미가 아닙니다. 논문의 실험 환경, 질문 세트, 평가 지표에서는 신뢰할 수 있는 증거가 든 콘텐츠가 생성형 답변에 더 잘 흡수돼 가시성이 높게 측정됐다는 뜻입니다.

더 주의할 결론은 키워드 강화입니다. 이 방법은 약했고 일부 지표에서는 기준선보다 낮았습니다. Perplexity.ai 실험에서도 전통 SEO식 키워드 강화는 Position-Adjusted Word Count에서 기준선보다 나빴습니다. 생성형 엔진은 단순 단어 매칭이 아니라 판단 근거·이유·증거를 가진 정보를 압축하기 때문입니다.

콘텐츠 팀이 적용할 원칙

GEO를 키워드 목록으로 만들지 마세요. AI가 브랜드 카테고리를 이해해야 하지만, 동의어 반복과 얇은 대량 콘텐츠는 신뢰 출처를 만들기 어렵습니다. 대신 제품 역량, 버전 차이, 가격 기준, 고객 사례, 업계 데이터, 인증, 방법론 출처, 비교표, FAQ처럼 답변에 필요한 인용 가능 근거를 채우세요.

통계에는 산정 기준을, 사례에는 상황을, 기능 설명에는 적용 경계를 붙여 사실·의견·홍보 표현을 구분해야 합니다. 또한 질문 종류에 따라 통계, 인용, 인용문, 쉬운 설명 중 무엇을 우선할지 다르게 정해야 합니다.

GEO Radar와 실험 논리의 결합

기업이 논문을 그대로 재현할 필요는 없지만 논리는 빌릴 수 있습니다. GEO Radar에서 https://www.georadar.top 에 핵심 추천, 경쟁사 비교, 가격·예산, 위험 우려, 상황별 해결 질문을 고정 세트로 만들고 브랜드 언급, 인용 출처, 추천 위치, 이유를 기록하세요.

그다음 공식 콘텐츠를 작은 단위로 바꿉니다. 사례를 보완하거나 FAQ를 갱신하고, 데이터 기준이나 제3자 근거를 정리할 때마다 한 종류의 변경만 적용한 뒤 일정 기간 후 재검증합니다. 플랫폼의 자연 변동을 개선 효과로 오해하지 않기 위해서입니다. 이 논문이 주는 핵심은 "감으로 고치기" 대신 질문 세트·기준선·변경 기록·재검증을 갖춘 실험으로 GEO를 다루라는 것입니다.

이 글의 자료 출처