BoostStep:通过改进的单步推理提升大型语言模型的数学能力
计算与语言
2025-02-18 v3 人工智能
机器学习
摘要
大型语言模型(LLM)在解决具有多步推理的复杂数学问题方面展现了惊人的能力,并且可以通过设计良好的情境学习(ICL)示例进行进一步提升。然而,这一潜力往往受到 ICL 两个主要挑战的制约:粒度不匹配和无关信息。我们观察到,尽管 LLM 在分解数学问题方面表现出色,但在细粒度步骤中常常会出现推理错误。此外,基于问题水平检索的 ICL 示例可能遗漏关键步骤,甚至通过无关细节误导模型。为解决此问题,我们提出了 BoostStep 方法,通过步骤对齐 ICL 来增强推理准确性,这是一种仔细将检索到的参考步骤与相应推理步骤对齐的新机制。此外,BoostStep 还包含一种有效的“首次尝试”策略,以提供与当前推理状态高度相关的示例。BoostStep 是一种灵活且强大的方法,可以无缝集成到链式思维(CoT)和树搜索算法中,优化候选选择和决策。实证结果表明,BoostStep 将 GPT-4o 的 CoT 性能在数学基准测试中提升了 4.6%,显著优于传统few-shot学习的 1.2%。此外,结合树搜索可实现额外的 7.5% 提升。意外的是,它能够使用更简单的示例提升到最先进的 LLM 以解决具有挑战性的数学问题。它改进了 DeepSeek-R1-671B 在 AIME 上的性能,通过仅使用来自 MATH 数据集的简单示例实现 2.2% 的提升。
引用
@article{arxiv.2501.03226,
title = {BoostStep: Boosting mathematical capability of Large Language Models via improved single-step reasoning},
author = {Beichen Zhang and Yuhong Liu and Xiaoyi Dong and Yuhang Zang and Pan Zhang and Haodong Duan and Yuhang Cao and Dahua Lin and Jiaqi Wang},
journal= {arXiv preprint arXiv:2501.03226},
year = {2025}
}
备注
Codes and Data are available at https://github.com/beichenzbc/BoostStep