在GSM8K上实现超过97%:深入理解问题使大语言模型成为更好的数学应用题求解器
计算与语言
2025-03-28 v5 人工智能
摘要
思维链(CoT)提示增强了大型语言模型(LLM)在各种推理任务上的性能。然而,CoT在处理复杂的数学应用题时仍然不足,因为它通常遭受三个陷阱:语义理解错误、计算错误和步骤缺失错误。先前的研究涉及解决计算错误和步骤缺失错误,但忽略了语义理解错误,这是限制LLM推理性能的主要因素。为此,我们提出了一种简单而有效的方法,即深入理解问题(DUP),通过解决语义理解错误来提高LLM的数学问题求解能力。我们方法的核心是鼓励LLM深入理解问题并提取用于更好推理的关键问题解决信息。在10个不同的推理基准上的大量实验表明,我们的DUP方法以较大优势持续优于其他对应方法。更令人鼓舞的是,DUP在GSM8K基准上取得了新的SOTA结果,在零样本设置下准确率达到97.1%。
引用
@article{arxiv.2404.14963,
title = {Achieving >97% on GSM8K: Deeply Understanding the Problems Makes LLMs Better Solvers for Math Word Problems},
author = {Qihuang Zhong and Kang Wang and Ziyang Xu and Juhua Liu and Liang Ding and Bo Du},
journal= {arXiv preprint arXiv:2404.14963},
year = {2025}
}
备注
The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: { 10.1007/s11704-025-41102-z }