参考文献・書誌一覧

本サイトが根拠とする論文・文書の書誌を公開します。arXiv ID・DOI・venue(査読済み採択先)・preprint 表記を分けて表示し、引用の透明性を保ちます。

arXiv は preprint リポジトリです。venue 欄は査読済み学会/ジャーナル採択を示します。 peerReviewed=true の場合のみ venue を記載。venue の正確性は要ユーザー承認(未確認は未確認と表示)。

Lost in the Middle: How Language Models Use Long Contexts

peer-reviewed ACL 2024 2023

Nelson F. Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, Percy Liang

arXiv
2307.03172
Repo
arXiv
Benchmarks
long-context-probe
Checked
2026-07-14

LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding

peer-reviewed ACL 2024 2023

Yushi Bai, Xin Lv, Jiajie Zhang, Hongchang Lyu, Jiankai Tang, Zhidian Huang, Zhengxiao Du, Xiao Liu, Aohan Zeng, Lei Hou, Yuxiao Dong, Jie Tang, Juanzi Li

arXiv
2308.14508
Repo
arXiv
Benchmarks
LongBench
Checked
2026-07-14

SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

peer-reviewed ICLR 2024 2023

Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, Karthik R. Narasimhan

arXiv
2310.06770
Repo
arXiv
Benchmarks
SWE-bench
Checked
2026-07-14

Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference

peer-reviewed JMLR 2024 2024

Wei-Lin Chiang, Lianmin Zheng, Ying Sheng, Anastasios Nikolas Angelopoulos, et al.

arXiv
2403.04132
Repo
arXiv
Benchmarks
Chatbot Arena
Checked
2026-07-14

Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge

peer-reviewed ACL 2024 2024

Guangyu Yang, Yuqing Wang, Renliang Sun, et al.

arXiv
2406.07791
Repo
arXiv
Benchmarks
LLM-as-a-Judge
Checked
2026-07-14

State of AI: An Empirical 100 Trillion Token Study with OpenRouter

preprint 2026

Malika Aubakirova, Alex Atallah, Chris Clark, Justin Summerville, Anjney Midha

arXiv
2601.10088
Repo
arXiv
Benchmarks
OpenRouter usage
Checked
2026-07-15

最終確認: 2026-07-16