中文

理由并非万能药:衡量理由对模型性能与可靠性的影响

计算与语言 2025-06-02 v1

摘要

在许多现有工作中,使用理由增强训练语言模型已被证明是有益的。在本文中,我们发现这种普遍观点并不总是一致成立。我们进行了全面调查,以彻底检查理由对模型性能以及模型可靠性这一新颖视角的影响。结果得出了几项为现有理解增添新见解的关键发现:1)理由有时会降低模型性能;2)理由有时能提升模型可靠性,甚至优于其未经训练的对应模型;3)性能与可靠性的提升之间存在线性对应关系,且两者均由任务的内在难度驱动。这些发现为理由的广泛使用提供了有益的规范,并对将语言模型与隐式人类思维进行显式对齐的过程提出了关键启示。代码可在 https://github.com/Ignoramus0817/rationals 找到。

关键词

引用

@article{arxiv.2505.24147,
  title  = {Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability},
  author = {Chiwei Zhu and Benfeng Xu and An Yang and Junyang Lin and Quan Wang and Chang Zhou and Zhendong Mao},
  journal= {arXiv preprint arXiv:2505.24147},
  year   = {2025}
}

备注

To be published in ACL 2025 Findings. (Work originally done in Jan 2024)