ページの関連度が高ければAIは本当に使ったのか?GEO帰属の錯覚
最新の生成検索研究でBM25、意味類似度、因果的な除外プローブを比較し、関連ページを実利用と誤認しないGEO帰属の証拠段階を示します。
ページの関連度が高ければAIは本当に使ったのか?GEO帰属の錯覚
ページが質問や回答と意味的に近くても、そのページが生成文を支えたとは限りません。類似度が示すのは「使えそう」までで、「実際に依存した」ことではありません。類似度スコアをコンテンツ寄与率として報告するのは、GEOの帰属を越えた表現です。
2026年8月24日公開の論文 *The Laws of Context Allocation* は、同一クエリのハードネガティブを構築しました。質問との話題関連性は高いものの、目的回答を含まず、含意もしない文書です。別トピックの簡単な負例ではBM25と埋め込み類似度のAUCがほぼ1に見えましたが、同一クエリのハードネガティブに替えると、3文書の条件でBM25は0.444、質問—文書コサイン類似度は0.484まで低下し、ほぼランダムでした。
一方、削除型leave-one-outプローブは同条件で0.876、24文書でも0.824でした。生成済み回答を固定し、文脈文書を一つずつ除き、同じ回答のトークン尤度がどれだけ下がるかを測ります。文書を除くと実現済み回答が明確に生成しにくくなるなら、依存を示す証拠は強くなります。
3つの信号を分ける
検索関連性は「質問に合う文書か」、表示引用は「システムが出典として見せたか」、反実仮想依存は「その文書なしで同じ回答が成立しにくいか」を問います。3つが一致することも、分かれることもあります。
自社RAGなら、モデル、プロンプト、生成済み回答を固定して文書を除外し、尤度や重要主張の変化を記録できます。検証用負例には、明らかな無関係ページだけでなく同じ質問に関連する近接例を入れます。
ChatGPT、Gemini、Perplexityなどの閉じたサービスでは、外部ブランドは完全な文脈プールやトークン確率を通常見られません。そこで実務報告は証拠段階を使います。話題類似、主張を支持する表示引用、反復実行での安定共起、そして制御可能なシステムで事前設計した除外実験を行った場合に限る慎重な因果表現、という順です。
重要事実ごとに、質問、回答全文、表示出典、ページ版、取得時刻、主張と出典の支持関係、実験制御の程度を保存します。「関連の可能性」「引用表示」「主張支持」「除外で変化」を別列にし、見かけ上精密な影響点へまとめません。
GEO Radarは https://www.georadar.top でブランド出現、プラットフォーム差、引用、履歴回答を観測し、最初の3段階を記録できます。これは監査可能な観測層であり、類似や共起だけでページが回答を生んだと証明するものではありません。
研究対象は制御されたRAG、オープンモデル、QAベンチマークです。すべての商用回答エンジンが同じ編成を使うとは示していません。直接の価値は、難しい負例と節度ある帰属表現にあります。
この記事の情報源
- arXiv、2026年8月24日、*The Laws of Context Allocation: Causal Measurement and Closed-Loop Orchestration in Generative Search*:https://arxiv.org/abs/2608.23252
- arXiv HTML全文(同一クエリのハードネガティブ、leave-one-out、十分集合、実験設定):https://arxiv.org/html/2608.23252v1
- 著者公開のコード、データ、測定ツール:https://github.com/PeiYangLiu/ascp