中文

基准剖析:LLM基准的机制诊断

计算与语言 2025-10-03 v1 人工智能

摘要

大语言模型通常以其在标准基准测试上的得分来评判,但此类得分往往高估了真实能力,因为它们掩盖了任务实际所需的技能组合。例如,ARC被认为测试推理能力,而HellaSwag旨在评估常识。然而,我们缺乏系统的方法来验证这些基准是否实际测量了这些标签。我们引入了基准剖析,一种将基准性能分解为十种认知基础能力的诊断框架。该方法结合了基于梯度的重要性评分与针对性参数消融,以计算能力影响分数(AIS),量化每种能力对模型在特定基准上成功的贡献。对三个指令调优模型在十个广泛使用的基准测试上进行剖析,得出四个关键发现:(i)大多数基准测试依赖于多种能力而非单一能力,(ii)具有相似标签的数据集依赖于不同的能力组合,(iii)代码生成基准测试奖励广泛的、多技能的提升,因此仅显示出适度的窄域特定微调增益,(iv)与任务无关的能力可能会对性能产生负面影响。因此,基准剖析解释了为什么性能提升并不总是转化为用户感知的胜任力,并提供了一个透明的基准审核和模型可解释性工具。

关键词

引用

@article{arxiv.2510.01232,
  title  = {Benchmark Profiling: Mechanistic Diagnosis of LLM Benchmarks},
  author = {Dongjun Kim and Gyuho Shim and Yongchan Chun and Minhyuk Kim and Chanjun Park and Heuiseok Lim},
  journal= {arXiv preprint arXiv:2510.01232},
  year   = {2025}
}

备注

16 pages, 5 figures. Accepted to EMNLP 2025 main conference