LLMs 能更好地解决更长的数学应用题吗?
计算与语言
2025-02-27 v4
摘要
数学应用题(MWP)在评估大型语言模型(LLM)能力方面起着至关重要的作用,但目前的研究主要集中于上下文简洁的问题。较长上下文对数学推理的影响仍未得到充分探索。本研究率先调查了上下文长度泛化性(CoLeG),即LLM解决具有扩展叙述的MWP的能力。我们引入了扩展小学数学(E-GSM),这是一个包含长篇叙述的MWP集合,并提出了两个新颖的指标来评估LLM在解决这些问题时的有效性和韧性。我们对现有使用专有LLM和开源LLM的零样本提示技术的分析揭示了CoLeG普遍不足。为了缓解这些问题,我们针对不同类别的LLM提出了定制方法。对于专有LLM,我们引入了一种新的指令提示,旨在减轻长上下文的影响。对于开源LLM,我们开发了一种新颖的辅助任务进行微调以增强CoLeG。我们的综合结果证明了所提出方法的有效性,在E-GSM上显示出改进的性能。此外,我们进行了深入分析以区分语义理解和推理效能的影响,表明我们的方法改进了后者。我们还建立了我们的方法在多个其他MWP基准上的泛化性。我们的发现突出了当前LLM的局限性,并相应地提供了实用的解决方案,为模型泛化性和训练方法的进一步探索铺平了道路。
引用
@article{arxiv.2405.14804,
title = {Can LLMs Solve longer Math Word Problems Better?},
author = {Xin Xu and Tong Xiao and Zitong Chao and Zhenya Huang and Can Yang and Yang Wang},
journal= {arXiv preprint arXiv:2405.14804},
year = {2025}
}
备注
Accepted to ICLR 2025