LEMMA:面向数学进步的错误学习
机器学习
2025-06-02 v2 人工智能
摘要
大型语言模型 (LLMs) 在解决数学问题方面已显示出惊人的推理能力。然而,现有方法主要致力于提高正确训练数据的质量,例如从高级模型中提炼高质量正确解答,忽略了错误数据中所蕴含的价值,可能阻碍模型的反思能力。虽然一些研究试图利用错误数据,但通常涉及复杂机制,例如蒙特卡洛树搜索 (MCTS) 以探索错误节点。本文提出通过学习错误以实现数学进步 (LEMMA) 来增强LLMs的推理能力。LEMMA 构建由不正确解答及其错误步骤以及与正确解答之间的反思联系组成的数据,用于微调。具体而言,我们系统性地分析模型生成的错误类型,并引入基于错误类型的错误丰富方法,以收集多样且具代表性的错误。正确的解答要么是通过修复错误,要么是全新生成。通过模型感知的平滑反思联系,将错误解答传递到正确解答。通过在构建的数据集上进行微调,模型能够在生成过程中自行纠正错误,而无需依赖外部批评模型。实验结果表明,LEMMA 在多个强大基准上实现了显著的性能提升。
引用
@article{arxiv.2503.17439,
title = {LEMMA: Learning from Errors for MatheMatical Advancement in LLMs},
author = {Zhuoshi Pan and Yu Li and Honglin Lin and Qizhi Pei and Zinan Tang and Wei Wu and Chenlin Ming and H. Vicky Zhao and Conghui He and Lijun Wu},
journal= {arXiv preprint arXiv:2503.17439},
year = {2025}
}
备注
ACL'25 Findings, Code is available at https://github.com/pzs19/LEMMA