语言模型微基准测试的可靠性如何?
计算与语言
2026-03-09 v2 机器学习
摘要
微基准测试提供了一种解决方案,以克服语言模型开发中常常昂贵的耗时和成本:在现有基准测试的 very small subset 上进行评估。然而,这些微基准测试能否像它们所取代的完整基准测试一样一致地对模型进行排序?它们能否比选择随机数据点子集更一致地对模型进行排序?在许多情况下,我们发现答案是否定的。我们引入一种用于微基准测试的 meta-评估 measure,调查微基准测试如何作为其性能差异函数于完整基准测试的函数,对两个模型进行排序。这种方法可以确定微基准测试能否正确排序模型对,允许对微基准测试规模与可靠性之间的权衡进行更细致的分析。先前的工作表明只需选择 10 个例子;我们发现没有任何微基准测试方法能 consistently 对 MMLU-Pro 上相距 3.5 分的模型对进行排序,或对 BIG-bench Hard 上相距 4 分的模型对进行排序。为了 consistently 对排名相对相似的模型对进行排序,我们发现通常需要选择最多 250 个例子,此时随机抽样与现有微基准测试方法并驾齐驱。在比较 8B 指令调优模型在 MMLU-Pro 微基准测试中仅使用 25 个例子时,我们发现超过一半的两两比较不太可能被保留。我们的工作为微基准测试的用户和开发者在评估效率与可靠性之间的权衡提供了可操作的指导。
引用
@article{arxiv.2510.08730,
title = {How Reliable is Language Model Micro-Benchmarking?},
author = {Gregory Yauney and Shahzaib Saqib Warraich and Swabha Swayamdipta},
journal= {arXiv preprint arXiv:2510.08730},
year = {2026}
}
备注
Published at ICLR 2026