コンテキスト長と実効コンテキスト

「100万トークン対応」だからといって、すべての長文が一様に扱えるわけではない。advertised contextとeffective contextの非同一性を整理する。

結論

  • 公式のcontext window長(advertised)と、実効的に使いこなせる長さ(effective)は同義ではない。
  • 長い入力の中で、特に中央付近の情報が取りこぼされる傾向(Lost in the Middle)が報告されている。
  • タスク・配置位置・言語によって結果が変わる。context上限だけで「長文最強」と判断しない。

Research question

モデルが「最大Nトークン」に対応していても、実際のタスクでどこまでの情報を正しく利用できるか。

実用への含意(Practical implication)

  • 長文RAGや全文要約では、単に「長いモデル」を選ぶのではなく、検証が必要。
  • 重要情報はプロンプトの先頭・末尾に配置する設計を検討する。
  • 本サイトのモデルページは「Advertised context」と「独立effective-context証拠」を分けて表示する(Loop 6で実装予定)。

モデル選定への影響(Model selection impact)

「長文に強い」という単一バッジを廃止し、公式仕様(advertised)と研究上の注意(effective)を分離して表示する。現行モデルへの過剰一般化はしない。

限界(Limitations)

  • 引用論文の実験モデルは2023年時点で、現行2026モデルの具体的スコアを提示していない。
  • Chinese/Englishの結果を日本語へそのまま一般化しない。

論文の適用可能性(Study applicability)

各論文が「実際に何を示したか」「どこまで一般化できるか」を明示。現行2026モデルへの過剰一般化を避ける。

論文示したこと一般化の限界適用可適用不可
Lost in the Middle: How Language Models Use Long Contexts 長い入力の中央位置で性能が低下する傾向(position bias in long context)を実証。 実験は主に英語・特定モデル(GPT-3.5/4等)。中国語/日本語へのそのまま一般化は不可。現行モデルの具体的scoreは示さない。 any 特定現行モデルの effective context 数値推定
LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding 長文理解を多言語(中/英)・多タスクで評価するベンチマークの例を提示。 掲載モデルは2023年頃。現行モデルの具体的scoreは未掲載。 any 現行モデルの LongBench score 断言

参考文献(References)

  • Lost in the Middle: How Language Models Use Long Contexts(Nelson F. Liu et al., 2023)— : 2307.03172 研究上の一般的注意
    advertised context length と effective context は同義でない。長い入力で性能が一様に維持されるとは限らない。
  • LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding(Yushi Bai et al., 2023)— : 2308.14508 研究上の一般的注意
    長文理解を多言語・多タスクで評価するベンチマークの一例。現行モデルの score は掲載対象外。

関連ページ

更新日: 2026-07-16。出典は各論文のarXiv公開情報(preprint)。

Provenance・編集方針

  • 著者・編集: ykio(サイト運営者)。外部寄稿なし。
  • 出典: 各論文はarXiv公開情報(preprint)。DOIは推測せずIDのみ。
  • 一般化の限界: 論文の対象モデル・年代・タスクを超えて現行モデルへ過剰一般化しない(§17)。
  • 独立証拠: 現行モデルの実効性能は独立ベンチマーク証拠なしと明示(§8.2, §11.2-11.4)。
  • 引用: 可。出典明記を推奨。サイト表示と矛盾する場合は本文を優先。