エージェント向けモデル

ツール呼び出しや複数ステップの実行を伴うエージェントに向くモデルを、対応機能と再試行コストから整理します。

評価軸

  • tool use / function calling の安定性
  • structured output(JSON等の決まった形式出力)
  • reasoning(複数ステップの計画・検証)
  • 長いセッションでのコンテキスト保持
  • 再試行コスト(エラー時のリトライが積み上がる)
  • プロバイダーの安定性・API互換性

実測していないレイテンシ・稼働率は断定していません。公式出典と本番運用の検証に基づいて判断してください。

候補モデル(verified)

モデルreasoningコンテキスト
Tencent Hy3 262K
OpenAI GPT-5.6 1.05M
Claude Sonnet 5 1M
Grok 4.5 500K
DeepSeek V3.2 131K
Gemini 3.5 Flash 1.048576M
Qwen3.6 Max 262K
GLM 5 203K