どうLLMを比較すべきか
単一の精度スコアや、LLMに判定させた順位だけでモデルを選ぶのは危うい。研究が示す多面的・複数軸の評価方法を整理する。
結論
- モデル評価は単一accuracyではなく、用途と複数の指標に分けて行う(HELMの枠組み)。
- LLM-as-a-judge単独での自動順位付けは、position等のbiasのため断定的に公開すべきでない。
- 人間の好み(preference)と客観的正解率(correctness)は別の軸である。
- 本サイトは「最強モデル」を1つ決めず、要件と証拠の一致で候補を絞る。
Research question
「どのモデルが一番良いか」は、どのタスク・どの指標・どの評価者で測るかで答えが変わる。それをどう分解して評価するか。
実用への含意(Practical implication)
- 比較表は「得意/不得意」を軸ごとに分け、総合1位を出さない。
- 順位ではなく「要件を満たす/満たさない/不確実」で表示する。
- 日本語性能やコーディング性能の断定は、独立ベンチマークのexact version一致が条件。
モデル選定への影響(Model selection impact)
本サイトの比較ツールは、低コスト・コーディング・長文・エージェント・日本語等の優先度をユーザーが調整できる。結果は選好に敏感であり、固定の「1位」は出さない(Loop 7で実装予定)。
限界(Limitations)
- 引用論文は2022-2024年の一般的方法論であり、現行2026モデルの性能証明には使用していない。
- 論文の具体的スコアを現行モデルのランキングに転用していない。
論文の適用可能性(Study applicability)
各論文が「実際に何を示したか」「どこまで一般化できるか」を明示。現行2026モデルへの過剰一般化を避ける。
| 論文 | 示したこと | 一般化の限界 | 適用可 | 適用不可 |
|---|---|---|---|---|
| Holistic Evaluation of Language Models | 単一accuracyだけでなく、use-case と複数metrics(robustness, fairness, toxicity, efficiency 等)で評価する枠組みを提示。 | 提示時点のモデルは2022年頃。現行2026モデルの性能証明には使用しない。 | any | 現行2026モデルの順位付け |
| Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge | LLM-as-a-judge に position 等の bias があり得る。 | single judge の自動順位を断定的に公開しない。randomized order/multiple judges/human review を推奨。 | any | LLM-judge 単独での性能順位公開 |
| Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge | LLM-as-a-judge に複数の bias が定量的に確認されている。 | bias を無視した自動順位公開は不可。 | any | bias 無視の自動順位 |
| Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference | pairwise human preference は一つの評価軸。crowdsourced preference には価値がある。 | preference と objective correctness は別。Arena rank を総合能力の絶対順位と表現しない。timestampなし順位掲載・category違いscore比較は不可。 | any | 現行モデルの総合順位(Arenaベース) |
参考文献(References)
- Holistic Evaluation of Language Models(Percy Liang et al., 2022)— : 2211.09110 研究上の一般的注意
single accuracy だけでモデルを評価しない。use-case と複数 metrics(robustness, fairness, toxicity, efficiency 等)を分ける。 - Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge(Guangyu Yang et al., 2024)— : 2406.07791 研究上の一般的注意
LLM judge には position 等の bias があり得る。single judge の自動順位を断定的に公開しない。 - Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge(Yuhan Liu et al., 2024)— : 2410.02736 研究上の一般的注意
LLM-as-a-judge に複数の bias が定量的に確認されている。 - Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference(Wei-Lin Chiang et al., 2024)— : 2403.04132 研究上の一般的注意
pairwise human preference は一つの評価軸。crowdsourced preference には価値があるが preference と objective correctness は別。
関連ページ
更新日: 2026-07-16。出典は各論文のarXiv公開情報(preprint)。
Provenance・編集方針
- 著者・編集: ykio(サイト運営者)。外部寄稿なし。
- 出典: 各論文はarXiv公開情報(preprint)。DOIは推測せずIDのみ。
- 一般化の限界: 論文の対象モデル・年代・タスクを超えて現行モデルへ過剰一般化しない(§17)。
- 独立証拠: 現行モデルの実効性能は独立ベンチマーク証拠なしと明示(§8.2, §11.2-11.4)。
- 引用: 可。出典明記を推奨。サイト表示と矛盾する場合は本文を優先。