一度に詰め込むか、狭く複数回生成するか?GEO証拠ポートフォリオの予算設計
最新の生成検索実験から、単一の広いコンテキストと複数の狭い生成を、証拠カバレッジ、トークン、遅延で比較し、GEO監視の予算実験へ落とし込みます。
一度に詰め込むか、狭く複数回生成するか?GEO証拠ポートフォリオの予算設計
合計24文書枠があるとき、24文書を一度に渡して1回生成するか、2文書ずつ12回生成するか。最新研究では証拠カバレッジは後者が優位でしたが、代表的比較ではトークンが増え、順次遅延は約10倍でした。これは無料の改善策ではなく、費用とカバレッジの前線です。
2026年8月24日の論文 *The Laws of Context Allocation* は、コンテキスト幅kと生成回数Tを分離して検証しました。同じ24枠で、2文書×12回は24文書×1回より証拠ポートフォリオ再現率が0.144高く、95%信頼区間は0.119〜0.170でした。論文は複数回生成の広範な利得を約16.8〜20.5ポイントとまとめ、Qwen 14B、32Bの拡張でも正方向を報告しています。
同じ回答を多く抽選しただけではありません。固定文脈から繰り返し生成しても再現率は上がりましたが、各回に新しい文書を入れるローテーションは、固定文脈の再サンプリングよりさらに0.087〜0.140高い絶対差を生みました。この実験では、言い換えの多様性より新しい証拠への接触が上限を引き上げました。
3種類の予算を分ける
文書予算はモデルが触れる証拠総量、生成予算は回数、検証予算は帰属プローブ、人手確認、重複排除の資源です。「同じ呼び出し回数」や「同じトークン」だけでは、別軸の差を隠します。
論文の代表例では、狭い複数回構成は約1.5倍のトークンを使い、順次処理17.5秒に対し、広い単一生成は約1.7秒でした。leave-one-outプローブにも、並列化可能ですが追加計算があります。単一の簡単な回答なら費用に見合わないことがあります。多くの独立事実、候補、エンティティを覆う調査課題に向きます。
ブランドチームの比較可能な実験
ブランドは商用AI検索の内部文脈配分を制御できませんが、監視予算は制御できます。複数事実を要する質問を選び、重要事実一覧を先に決めます。広い質問1件、狭い観点質問の組、制御された連続質問を比較し、プラットフォーム、日付範囲、総実行数、採点規則をそろえます。出典で支持された事実カバレッジ、ブランド出現、引用、重複、費用、所要時間を記録します。
全回答を単純に連結してはいけません。同義事実を重複排除し、矛盾する版を分け、回答で初めて知ったブランド名を初回質問へ戻さないようにします。戻せば回答側漏洩が入ります。
GEO Radarは https://www.georadar.top で観点別の固定質問群と複数プラットフォームの履歴回答を管理でき、この予算実験の収集層になります。外部サービスの検索窓は制御できず、論文の0.144もブランド可視性の保証ではありません。最長回答ではなく、新しく得た出典支持済み事実1件あたりの費用で判断します。
この記事の情報源
- arXiv、2026年8月24日、*The Laws of Context Allocation: Causal Measurement and Closed-Loop Orchestration in Generative Search*:https://arxiv.org/abs/2608.23252
- arXiv HTML全文(因子実験、証拠ローテーション、規模検証、費用と遅延):https://arxiv.org/html/2608.23252v1
- 著者公開のコード、データ、測定ツール:https://github.com/PeiYangLiu/ascp