中文

What the HellaSwag?论常识推理基准的有效性

计算与语言 2025-04-11 v1

摘要

常识推理是一项关键的语言模型能力,因为它不仅包含特定的事实知识,更包含对语言和世界的总体理解。因此,衡量常识推理对于不同规模和应用的语言模型至关重要。HellaSwag 是评估此类能力最广泛使用的基准之一;然而,在本文中,我们表明它存在严重的建构效度问题。这些问题从基本的语法错误和大量拼写错误,到误导性提示或同样正确的选项不等。此外,我们表明,如果仅基于答案文本评估模型,或者用“Lorem ipsum dolor...”代替问题,超过 65% 的模型预测保持不变,且这不能仅仅归因于数据污染。由于基准分数是研究和商业应用中模型选择的重要组成部分,这些效度问题可能产生严重后果。特别是,鉴于按基准分数表面价值行事的做法无处不在,不充分的评估会导致对模型做出不明智的决策。在本文中,我们深入调查了 HellaSwag 提出的关键效度问题,并使用不同规模的生成式语言模型通过各种评估加以说明。我们认为该基准不能准确衡量常识推理,因此不应在其当前状态下用于评估。基于我们的研究结果,我们提出了未来常识推理基准应满足的要求。此外,我们发布了 GoldenSwag,这是 HellaSwag 的一个修正子集,据我们所知,它有助于进行可接受的常识推理评估。

关键词

引用

@article{arxiv.2504.07825,
  title  = {What the HellaSwag? On the Validity of Common-Sense Reasoning Benchmarks},
  author = {Pavel Chizhov and Mattia Nee and Pierre-Carl Langlais and Ivan P. Yamshchikov},
  journal= {arXiv preprint arXiv:2504.07825},
  year   = {2025}
}