中文

HellaSwag-Pro:用于评估 LLM 常识推理鲁棒性的大规模双语基准

计算与语言 2025-05-27 v2

摘要

大型语言模型 (LLM) 在常识推理方面显示出惊人的能力;然而,某些问题变体会触发错误响应。这些模型是否真正理解常识知识,或者仅仅记忆了表达模式?为调查此问题,我们present了对 LLM 在常识推理中鲁棒性的首个广泛评估。我们引入 HellaSwag-Pro,一个由设计和编译的七种问题变体构成的大规模双语基准,包含 11,200 个案例。为构建此基准,我们提出了两种阶段的方法来开发中文 HellaSwag,这是一个涵盖 56 个类别的精细标注数据集,包含 12,000 个实例。我们在 41 个代表性 LLM 上进行了广泛实验,揭示了这些 LLM 在常识推理方面远非鲁棒。这种鲁棒性取决于 LLM 所测试的语言。这项工作建立了一个高质量的评估基准,广泛的实验为社区在 LLM 的常识推理方面提供了宝贵见解。

关键词

引用

@article{arxiv.2502.11393,
  title  = {HellaSwag-Pro: A Large-Scale Bilingual Benchmark for Evaluating the Robustness of LLMs in Commonsense Reasoning},
  author = {Xiaoyuan Li and Moxin Li and Rui Men and Yichang Zhang and Keqin Bao and Wenjie Wang and Fuli Feng and Dayiheng Liu and Junyang Lin},
  journal= {arXiv preprint arXiv:2502.11393},
  year   = {2025}
}

备注

ACL 2025 Findings