中文

Self-Error-Instruct:从错误中泛化以提升 LLM 数学推理能力

计算与语言 2025-05-29 v1 人工智能 机器学习

摘要

尽管大语言模型在各个领域展现出强大的性能,但它们在数学推理中仍存在大量错误案例。以往从错误中学习的方法仅通过从孤立的错误案例中进行外推来合成训练数据,从而未能泛化这些案例中固有的广泛模式。本文提出了 Self-Error-Instruct (SEI),这是一个解决这些模型弱点并合成更具泛化性的针对性训练数据的框架。具体而言,我们在两个数学数据集 GSM8K 和 MATH 上探索目标模型,以精准定位错误案例。然后,我们基于指导者模型 (GPT-4o) 的分析为这些案例生成错误关键短语,并通过聚类这些关键短语来识别错误类型。接下来,我们在每次生成过程中为每种识别出的错误类型采样少量错误案例,并将其输入到指导者模型中,该模型使用自指令方法合成额外的训练数据。这些新数据通过单次学习过程进行精炼,以确保仅保留最有效的样本。最后,我们使用这些精选数据微调目标模型,并迭代重复此过程以增强性能。我们将该框架应用于各种模型,观察到它们在同领域和跨领域数学数据集上的推理能力均有提升。这些结果证明了自错误指令通过错误泛化在提升 LLM 数学推理方面的有效性。

关键词

引用

@article{arxiv.2505.22591,
  title  = {Self-Error-Instruct: Generalizing from Errors for LLMs Mathematical Reasoning},
  author = {Erxin Yu and Jing Li and Ming Liao and Qi Zhu and Boyang Xue and Minghui Xu and Baojun Wang and Lanqing Hong and Fei Mi and Lifeng Shang},
  journal= {arXiv preprint arXiv:2505.22591},
  year   = {2025}
}

备注

16 pages, 9 figures