長文向けモデル
大容量ドキュメントの要約やRAGに向くモデルを、コンテキスト長と実用上の注意点から整理します。
実用上の注意
- コンテキスト上限は「入力+出力」の合計です。
- 長文の途中(lost-in-the-middle)は参照されにくい場合があります。
- 入力トークンが増えると費用が上昇します。RAGで関連箇所のみ渡す設計も検討。
- max output が小さいと、長い要約を一度に生成できません。
候補モデル(コンテキスト長順・verified)
| モデル | コンテキスト | max output |
|---|---|---|
| OpenAI GPT-5.6 | 1,050,000 tok | 128,000 tok |
| Gemini 3.5 Flash | 1,048,576 tok | 65,536 tok |
| Claude Sonnet 5 | 1,000,000 tok | 128,000 tok |
| Grok 4.5 | 500,000 tok | 未公表 |
| Tencent Hy3 | 262,144 tok | 未公表 |
| Qwen3.6 Max | 262,144 tok | 65,536 tok |
| Mistral Large 2512 | 262,144 tok | 未公表 |
| GLM 5 | 202,752 tok | 128,000 tok |
| DeepSeek V3.2 | 131,072 tok | 64,000 tok |
| Llama 3.3 70B | 131,072 tok | 16,384 tok |