長文向けモデル

大容量ドキュメントの要約やRAGに向くモデルを、コンテキスト長と実用上の注意点から整理します。

実用上の注意

  • コンテキスト上限は「入力+出力」の合計です。
  • 長文の途中(lost-in-the-middle)は参照されにくい場合があります。
  • 入力トークンが増えると費用が上昇します。RAGで関連箇所のみ渡す設計も検討。
  • max output が小さいと、長い要約を一度に生成できません。

候補モデル(コンテキスト長順・verified)

モデルコンテキストmax output
OpenAI GPT-5.6 1,050,000 tok 128,000 tok
Gemini 3.5 Flash 1,048,576 tok 65,536 tok
Claude Sonnet 5 1,000,000 tok 128,000 tok
Grok 4.5 500,000 tok 未公表
Tencent Hy3 262,144 tok 未公表
Qwen3.6 Max 262,144 tok 65,536 tok
Mistral Large 2512 262,144 tok 未公表
GLM 5 202,752 tok 128,000 tok
DeepSeek V3.2 131,072 tok 64,000 tok
Llama 3.3 70B 131,072 tok 16,384 tok