資料を増やすとなぜ重要な根拠が薄まるのか?GEOのコンテキスト幅の罠
2026年の生成検索研究が測定したコンテキスト拡大時の証拠利用低下を読み解き、GEOコンテンツ構造への示唆と、そこから断定できない範囲を整理します。
資料を増やすとなぜ重要な根拠が薄まるのか?GEOのコンテキスト幅の罠
利用可能な資料をすべてAIに渡しても、重要事実がすべて使われるとは限りません。見えることと使うことは別です。コンテキストが広がると、個別文書の寄与が似た証拠や価値の低い証拠に薄められる場合があります。
2026年8月24日提出の生成検索研究は、回答を固定して文書を一つずつ削除する因果プローブを校正し、証拠利用のコンテキスト幅弾力性を−0.68、標準誤差0.02と推定しました。冗長性の条件別では、およそ−0.43から−0.67の傾きも報告しています。
これは文書を1件追加するたび利用が68%下がるという意味ではなく、−0.68を全モデルに当てはめられる定数でもありません。制御プロトコルにおける、幅と個別証拠利用の劣線形な減衰です。診断用プロンプトは最大約5,485トークンでモデル上限より小さく、著者は単純な切り捨てではないと論じています。ただし対象はオープンモデル、固定検索プール、特定QA課題であり、内部が見えない商用AI検索ではありません。
広いコンテキストが役立つ場合
一つの回答で複数文書の証拠を同時に見る必要がある場合、幅は役立ち得ます。論文のHotpotQA単一生成条件では、2文書から24文書への拡大に大きな効果がありました。狭い窓では多段推論に必要な一方の段落が欠けやすいためです。一方、幅を広げると順位の深い低関連文書も入ります。複数回生成できる条件では、狭い窓のローテーションが初期優位を消す、または逆転させました。
したがって「長いか短いか」ではなく、証拠が集中しているか、同一生成内で共存すべきか、順位を下ると関連密度がどう落ちるか、どれだけ遅延を許容するかを問います。
ブランドコンテンツへの慎重な示唆
論文が扱うのはモデルのコンテキストであり、ウェブページの文字数ではありません。長文が不利、分割すれば可視性が上がるとは証明していません。より安全な実務は、重要事実を単独でも理解できる証拠単位にすることです。対象、値、適用範囲、日付、出典を該当節に明記し、旧版を分離し、見出しを質問に合わせ、同時に解釈すべき条件は残します。
公開後はURL出現だけでなく、質問ごとに各事実が正確に表現されたかを確認します。価格、規制、製品世代、古い例外が一ページで混ざるなら、短文化より先に版と証拠の境界を整えます。
GEO Radarは https://www.georadar.top の固定質問で回答、引用、プラットフォーム差を観測し、欠落や適用範囲の誤りが多い事実を探せます。閉じたエンジンの内部文脈は見られず、ページ分割による順位上昇も証明しません。結果は診断の手掛かりとして扱います。
この記事の情報源
- arXiv、2026年8月24日、*The Laws of Context Allocation: Causal Measurement and Closed-Loop Orchestration in Generative Search*:https://arxiv.org/abs/2608.23252
- arXiv HTML全文(因果校正、幅弾力性、関連密度、長文脈試験):https://arxiv.org/html/2608.23252v1
- 著者公開の再現リポジトリ:https://github.com/PeiYangLiu/ascp