エージェント向けモデル
ツール呼び出しや複数ステップの実行を伴うエージェントに向くモデルを、対応機能と再試行コストから整理します。
評価軸
- tool use / function calling の安定性
- structured output(JSON等の決まった形式出力)
- reasoning(複数ステップの計画・検証)
- 長いセッションでのコンテキスト保持
- 再試行コスト(エラー時のリトライが積み上がる)
- プロバイダーの安定性・API互換性
実測していないレイテンシ・稼働率は断定していません。公式出典と本番運用の検証に基づいて判断してください。
候補モデル(verified)
| モデル | reasoning | コンテキスト |
|---|---|---|
| Tencent Hy3 | ○ | 262K |
| OpenAI GPT-5.6 | ○ | 1.05M |
| Claude Sonnet 5 | ○ | 1M |
| Grok 4.5 | ○ | 500K |
| DeepSeek V3.2 | ○ | 131K |
| Gemini 3.5 Flash | ○ | 1.048576M |
| Qwen3.6 Max | ○ | 262K |
| GLM 5 | ○ | 203K |