中文

GSM-Symbolic:理解大型语言模型数学推理的局限性

机器学习 2025-08-28 v2 人工智能

摘要

近年来,大型语言模型(LLMs)在数学方面推理能力的提升引发了广泛关注。GSM8K基准测试广泛用于评估模型在小学水平问题上的数学推理能力。尽管LLMs在GSM8K上的表现在近年来显著提升,但其数学推理能力是否真正进步仍不明确,这引发了对报告指标可靠性的质疑。为此,我们对多个SOTA开源和闭源模型进行大规模研究。为克服现有评估的局限性,我们引入GSM-Symbolic,这是一个由符号模板生成多样化问题集合的改进基准。GSM-Symbolic实现了更可控的评估,提供关键见解和更可靠的指标,用于衡量模型推理能力。我们的发现表明,LLMs在回应同一问题的不同实例时表现出显著方差。具体而言,所有模型在GSM-Symbolic基准中,当仅更改问题中的数值时,性能都会下降。此外,我们研究了这些模型数学推理的脆弱性,表明随着问题子句数的增加,性能显著恶化。我们推测,这种下降是因为当前LLM无法进行真正的逻辑推理,它们从训练数据中复制推理步骤。添加一个看似与问题相关的单一子句会导致所有SOTA模型性能显著下降(最高可达65%),尽管该子句并不为最终答案的推理链提供贡献。总体而言,我们的工作提供了对LLMs在数学推理方面能力与局限性的更细致理解。

关键词

引用

@article{arxiv.2410.05229,
  title  = {GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models},
  author = {Iman Mirzadeh and Keivan Alizadeh and Hooman Shahrokhi and Oncel Tuzel and Samy Bengio and Mehrdad Farajtabar},
  journal= {arXiv preprint arXiv:2410.05229},
  year   = {2025}
}

备注

ICLR camera ready + additional discussion in the appendix