研究裏付け Methodology Hub

LLM API選定に役立つ評価方法論を、学術文献の知見から整理。各ページは結論・実用含意・制限・参考文献を明示。

研究ページ

ページ内容主な論文
LLMをどう比較すべきか 単一スコアではなく多面的な軸で評価する方法論。HELM等の知見を整理。 HELM
Context Window と Effective Context の違い Advertised context と実効contextは同義でない。Lost in the Middle 等の知見。 HELM
ベンチマークの限界 SWE-bench・Chatbot Arena・LLM-as-a-judge の注意点と過剰一般化の回避。 HELM
OpenRouter 100兆トークン研究 プラットフォーム内観測の読み方。利用量≠品質。 HELM

共通の注意

  • 論文は preprint(arXiv)として明記。現行2026モデルの性能証明には使用しない。
  • 一般化の限界: 対象モデル・年代・タスクを超えて過剰一般化しない(§17)。
  • 独立証拠: 現行モデルの実効性能は独立ベンチマーク証拠なしと明示(§8.2, §11.2-11.4)。