运用心理测量方法提升大语言模型评估榜单
计算与语言
2025-01-30 v1 人工智能
应用统计
摘要
大型语言模型(LLM)的快速发展 necessitates 创建基准测试以评估其性能。这些基准测试类似于人类测试和调查,因它们包含一组旨在衡量这些系统认知行为中新兴属性的题目。然而,与社会科学中既定特征和能力的研究不同,这些基准测试测量的属性往往较为模糊且缺乏严格的定义。最突出的基准测试通常被组织进入榜单以便于使用,聚合绩效指标并实现模型之间的比较。不幸的是,这些榜单通常依赖简单的聚合方法,例如对基准测试中的平均得分进行计算。本文展示了将当代心理测量方法——最初开发用于人类测试和调查——应用于提升大语言模型在榜单上排名方面的优势。以 Hugging Face 榜单数据为例,我们比较了常规 naïve 排名方法与心理测量方法排序的结果。研究发现,采用心理测量技术对于更稳健、有意义的评估大语言模型性能具有显著优势。
引用
@article{arxiv.2501.17200,
title = {Improving LLM Leaderboards with Psychometrical Methodology},
author = {Denis Federiakin},
journal= {arXiv preprint arXiv:2501.17200},
year = {2025}
}
备注
53 pages, 10 figures, 6 tables