改变答案顺序会降低 MMLU 的准确率
计算与语言
2024-11-12 v2
摘要
随着大型语言模型(LLM)的流行, particular benchmarks 对于评估这些模型以及理解模型能力至关重要。我们最常用的评估方法是对多个子任务的测试准确率进行平均,以在 leaderboard 上对模型进行排名,以确定适合我们用途的模型。本文我们调查了在广泛使用的多选问答数据集 MMLU 上,准确率测量的鲁棒性。当随机化答案标签内容时,我们发现所有探索的模型在 MMLU 上的准确率都会下降,但并非每个模型都 equally 敏感。这些发现表明,可能需要对标准的 leaderboard 测试实践进行调整,即额外考虑每个模型凭随机机会所能正确回答的示例百分比。
引用
@article{arxiv.2406.19470,
title = {Changing Answer Order Can Decrease MMLU Accuracy},
author = {Vipul Gupta and David Pantoja and Candace Ross and Adina Williams and Megan Ung},
journal= {arXiv preprint arXiv:2406.19470},
year = {2024}
}
备注
Short paper, 9 pages