平均值的缺陷:量化基准测试上性能均匀性
计算与语言
2025-10-01 v1 软件工程
摘要
基准测试塑造了关于模型能力的科学结论,并引导模型开发。这形成了一个反馈回路:更强的基准测试驱动更好的模型,而更好的模型又需要更具辨识力的基准测试。因此,确保基准测试的可靠性对于可信的评估和有意义的进步至关重要。本文从分布角度研究基准测试的可靠性,提出基准和谐(benchmark harmony)概念,用于衡量模型在基准测试子域中性能的均匀分布程度。我们认为,高和谐度是理想的基准测试属性,表明总体指标反映了跨子域的均匀能力。我们在19个多选基准测试和5个模型家族上进行测量,将每个基准测试映射到以模型在和谐度上的平均值和方差为坐标的平面上,其中高平均值和低方差信号指示更可靠的评估。我们的分析表明,较不和谐的基准测试可能给出误导性结果,因为总体准确率可能在特定子域上产生过度影响。例如,ARC-Easy因其在生物概念问题上的表现而被主导,掩盖了地理、物理、化学和环境科学等其他关键子域的重要性。通过建议在报告准确率时同时报告和谐度,我们将评估从简单的性能平均值重新框定为更稳健、在分布层面上可靠的绩效测量。
引用
@article{arxiv.2509.25671,
title = {The Flaw of Averages: Quantifying Uniformity of Performance on Benchmarks},
author = {Arda Uzunoglu and Tianjian Li and Daniel Khashabi},
journal= {arXiv preprint arXiv:2509.25671},
year = {2025}
}