研究裏付け Methodology Hub
LLM API選定に役立つ評価方法論を、学術文献の知見から整理。各ページは結論・実用含意・制限・参考文献を明示。
研究ページ
| ページ | 内容 | 主な論文 |
|---|---|---|
| LLMをどう比較すべきか | 単一スコアではなく多面的な軸で評価する方法論。HELM等の知見を整理。 | HELM 等 |
| Context Window と Effective Context の違い | Advertised context と実効contextは同義でない。Lost in the Middle 等の知見。 | HELM 等 |
| ベンチマークの限界 | SWE-bench・Chatbot Arena・LLM-as-a-judge の注意点と過剰一般化の回避。 | HELM 等 |
| OpenRouter 100兆トークン研究 | プラットフォーム内観測の読み方。利用量≠品質。 | HELM 等 |
共通の注意
- 論文は preprint(arXiv)として明記。現行2026モデルの性能証明には使用しない。
- 一般化の限界: 対象モデル・年代・タスクを超えて過剰一般化しない(§17)。
- 独立証拠: 現行モデルの実効性能は独立ベンチマーク証拠なしと明示(§8.2, §11.2-11.4)。