どうLLMを比較すべきか

単一の精度スコアや、LLMに判定させた順位だけでモデルを選ぶのは危うい。研究が示す多面的・複数軸の評価方法を整理する。

結論

  • モデル評価は単一accuracyではなく、用途と複数の指標に分けて行う(HELMの枠組み)。
  • LLM-as-a-judge単独での自動順位付けは、position等のbiasのため断定的に公開すべきでない。
  • 人間の好み(preference)と客観的正解率(correctness)は別の軸である。
  • 本サイトは「最強モデル」を1つ決めず、要件と証拠の一致で候補を絞る。

Research question

「どのモデルが一番良いか」は、どのタスク・どの指標・どの評価者で測るかで答えが変わる。それをどう分解して評価するか。

実用への含意(Practical implication)

  • 比較表は「得意/不得意」を軸ごとに分け、総合1位を出さない。
  • 順位ではなく「要件を満たす/満たさない/不確実」で表示する。
  • 日本語性能やコーディング性能の断定は、独立ベンチマークのexact version一致が条件。

モデル選定への影響(Model selection impact)

本サイトの比較ツールは、低コスト・コーディング・長文・エージェント・日本語等の優先度をユーザーが調整できる。結果は選好に敏感であり、固定の「1位」は出さない(Loop 7で実装予定)。

限界(Limitations)

  • 引用論文は2022-2024年の一般的方法論であり、現行2026モデルの性能証明には使用していない。
  • 論文の具体的スコアを現行モデルのランキングに転用していない。

論文の適用可能性(Study applicability)

各論文が「実際に何を示したか」「どこまで一般化できるか」を明示。現行2026モデルへの過剰一般化を避ける。

論文示したこと一般化の限界適用可適用不可
Holistic Evaluation of Language Models 単一accuracyだけでなく、use-case と複数metrics(robustness, fairness, toxicity, efficiency 等)で評価する枠組みを提示。 提示時点のモデルは2022年頃。現行2026モデルの性能証明には使用しない。 any 現行2026モデルの順位付け
Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge LLM-as-a-judge に position 等の bias があり得る。 single judge の自動順位を断定的に公開しない。randomized order/multiple judges/human review を推奨。 any LLM-judge 単独での性能順位公開
Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge LLM-as-a-judge に複数の bias が定量的に確認されている。 bias を無視した自動順位公開は不可。 any bias 無視の自動順位
Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference pairwise human preference は一つの評価軸。crowdsourced preference には価値がある。 preference と objective correctness は別。Arena rank を総合能力の絶対順位と表現しない。timestampなし順位掲載・category違いscore比較は不可。 any 現行モデルの総合順位(Arenaベース)

参考文献(References)

  • Holistic Evaluation of Language Models(Percy Liang et al., 2022)— : 2211.09110 研究上の一般的注意
    single accuracy だけでモデルを評価しない。use-case と複数 metrics(robustness, fairness, toxicity, efficiency 等)を分ける。
  • Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge(Guangyu Yang et al., 2024)— : 2406.07791 研究上の一般的注意
    LLM judge には position 等の bias があり得る。single judge の自動順位を断定的に公開しない。
  • Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge(Yuhan Liu et al., 2024)— : 2410.02736 研究上の一般的注意
    LLM-as-a-judge に複数の bias が定量的に確認されている。
  • Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference(Wei-Lin Chiang et al., 2024)— : 2403.04132 研究上の一般的注意
    pairwise human preference は一つの評価軸。crowdsourced preference には価値があるが preference と objective correctness は別。

関連ページ

更新日: 2026-07-16。出典は各論文のarXiv公開情報(preprint)。

Provenance・編集方針

  • 著者・編集: ykio(サイト運営者)。外部寄稿なし。
  • 出典: 各論文はarXiv公開情報(preprint)。DOIは推測せずIDのみ。
  • 一般化の限界: 論文の対象モデル・年代・タスクを超えて現行モデルへ過剰一般化しない(§17)。
  • 独立証拠: 現行モデルの実効性能は独立ベンチマーク証拠なしと明示(§8.2, §11.2-11.4)。
  • 引用: 可。出典明記を推奨。サイト表示と矛盾する場合は本文を優先。