基于伪双瘦网络的项目反应理论框架重新思考大型语言模型基准测试
计算与语言
2026-01-19 v3
摘要
通过基准测试评估大型语言模型 (LLM) 的做法广泛存在,但不同 leaderboard 之间的不一致以及顶级模型之间的差异较小引发了对其能否准确反映真实模型能力的关注。本文对基准测试的有效性进行了批判性分析,检阅主要 prominent LLM 基准测试,基于来自不同模型的结果进行分析。我们首先提出伪双瘦网络用于项目反应理论 (PSN-IRT),这是一种融合丰富项目参数于 IRT 基础架构之内的增强型项目反应理论框架。PSN-IRT 可用于 accurate 可靠地估计项目特征和模型能力。基于 PSN-IRT,我们对 11 个 LLM 基准测试中包含 41,871 个项目进行了广泛分析,揭示了其测量质量的显著且多样性不足。此外,我们展示了利用 PSN-IRT 能够构建更小的基准测试,同时保持更强的人类偏好对齐。
引用
@article{arxiv.2505.15055,
title = {Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory},
author = {Hongli Zhou and Hui Huang and Ziqing Zhao and Lvyuan Han and Huicheng Wang and Kehai Chen and Muyun Yang and Wei Bao and Jian Dong and Bing Xu and Conghui Zhu and Hailong Cao and Tiejun Zhao},
journal= {arXiv preprint arXiv:2505.15055},
year = {2026}
}
备注
Accepted to AAAI 2026 (Oral)