答案匹配优于多项选择:语言模型评估的新范式
计算与语言
2025-07-04 v1 人工智能
机器学习
摘要
多项选择基准测试长期以来一直是语言模型评估的主要工具,因为对多项选择进行评分是客观且易于自动化的。然而,我们表明,来自流行基准测试的多项选择题通常甚至可以在不看问题的情况下被回答。这些捷径源于判别式评估的一个根本性局限,而这种局限在模型自由形式的生成式答案评估中并不存在。直到最近,似乎还没有可行的、可扩展的多项选择替代方案——但我们表明,这种情况已经改变。我们通过所谓的答案匹配来考虑生成式评估:向候选模型提供不带选项的问题,让其生成自由形式的回答,然后使用一个带有参考答案的现代语言模型来判断该回答是否与参考答案匹配。为了比较不同评估策略的有效性,我们对MMLU-Pro和GPQA-Diamond进行了标注以获得人工评分数据,并衡量了每种评估方法的一致性。我们发现,使用近期模型(即使是小型模型)进行答案匹配可以达到近乎完美的一致性,处于标注者间一致性的范围内。相比之下,多项选择评估以及使用没有参考答案的LLM作为评判者的方法与人工评分的一致性较差。通过答案匹配改进评估不仅仅是一个概念性问题:当使用答案匹配评估模型的自由形式回答时,多个模型的排名发生了显著变化。基于这些发现,我们讨论了如何将评估生态系统从多项选择转向答案匹配。
引用
@article{arxiv.2507.02856,
title = {Answer Matching Outperforms Multiple Choice for Language Model Evaluation},
author = {Nikhil Chandak and Shashwat Goel and Ameya Prabhu and Moritz Hardt and Jonas Geiping},
journal= {arXiv preprint arXiv:2507.02856},
year = {2025}
}
备注
34 pages, Code is available at https://github.com/nikhilchandak/answer-matching