WinoWhat: 语义平行的 WinoGrande 句子语料库带常见语义分类
计算与语言
2025-04-01 v1 人工智能
摘要
本研究深入探讨了 Winograd 架构挑战如何用于评估大语言模型 (LLM) 的常识推理能力。具体而言,我们对不同规模的生成式模型在流行的 WinoGrande 基准测试上的表现进行评估。我们发布了 WinoWhat,一个新的语料库,其中包含 WinoGrande 验证集中每个实例的改写版本。此外,我们在五个常识知识类别上进行评估,提供了关于哪些类型的知识对 LLM 更具挑战性的细粒度见解。令人惊讶的是,所有模型在 WinoWhat 上的表现都显著低于 WinoGrande,暗示 LLM 的推理能力在 WinoGrande 上的表现被高估了。为验证这是否源于基准记忆效应,我们将基准实例匹配到 LLM 训练数据中,并创建了两个测试套件。我们观察到记忆对 WinoGrande 上模型性能的影响最小。
关键词
引用
@article{arxiv.2503.23779,
title = {WinoWhat: A Parallel Corpus of Paraphrased WinoGrande Sentences with Common Sense Categorization},
author = {Ine Gevers and Victor De Marez and Luna De Bruyne and Walter Daelemans},
journal= {arXiv preprint arXiv:2503.23779},
year = {2025}
}