arXiv は preprint リポジトリです。venue 欄は査読済み学会/ジャーナル採択を示します。
peerReviewed=true の場合のみ venue を記載。venue の正確性は要ユーザー承認(未確認は未確認と表示)。
Holistic Evaluation of Language Models
peer-reviewed TMLR 2023 2022
Percy Liang, Rishi Bommasani, Tony Lee, et al.
- arXiv
- 2211.09110
- Repo
- arXiv
- Benchmarks
- HELM
- Checked
- 2026-07-14
元論文を開く ↗
Lost in the Middle: How Language Models Use Long Contexts
peer-reviewed ACL 2024 2023
Nelson F. Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, Percy Liang
- arXiv
- 2307.03172
- Repo
- arXiv
- Benchmarks
- long-context-probe
- Checked
- 2026-07-14
元論文を開く ↗
LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding
peer-reviewed ACL 2024 2023
Yushi Bai, Xin Lv, Jiajie Zhang, Hongchang Lyu, Jiankai Tang, Zhidian Huang, Zhengxiao Du, Xiao Liu, Aohan Zeng, Lei Hou, Yuxiao Dong, Jie Tang, Juanzi Li
- arXiv
- 2308.14508
- Repo
- arXiv
- Benchmarks
- LongBench
- Checked
- 2026-07-14
元論文を開く ↗
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
peer-reviewed ICLR 2024 2023
Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, Karthik R. Narasimhan
- arXiv
- 2310.06770
- Repo
- arXiv
- Benchmarks
- SWE-bench
- Checked
- 2026-07-14
元論文を開く ↗
Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
peer-reviewed JMLR 2024 2024
Wei-Lin Chiang, Lianmin Zheng, Ying Sheng, Anastasios Nikolas Angelopoulos, et al.
- arXiv
- 2403.04132
- Repo
- arXiv
- Benchmarks
- Chatbot Arena
- Checked
- 2026-07-14
元論文を開く ↗
Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge
peer-reviewed ACL 2024 2024
Guangyu Yang, Yuqing Wang, Renliang Sun, et al.
- arXiv
- 2406.07791
- Repo
- arXiv
- Benchmarks
- LLM-as-a-Judge
- Checked
- 2026-07-14
元論文を開く ↗
Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge
peer-reviewed EMNLP 2024 2024
Yuhan Liu, et al.
- arXiv
- 2410.02736
- Repo
- arXiv
- Benchmarks
- LLM-as-a-Judge
- Checked
- 2026-07-14
元論文を開く ↗
State of AI: An Empirical 100 Trillion Token Study with OpenRouter
preprint 2026
Malika Aubakirova, Alex Atallah, Chris Clark, Justin Summerville, Anjney Midha
- arXiv
- 2601.10088
- Repo
- arXiv
- Benchmarks
- OpenRouter usage
- Checked
- 2026-07-15
元論文を開く ↗