中文

面向数学 LLM 的实用两阶段配方:通过 SFT 实现精度最大化,通过强化学习实现效率优化

机器学习 2025-07-14 v1 人工智能

摘要

增强大型语言模型(LLM)的数学推理能力是推进人工智能能力的关键挑战。虽然监督式微调(SFT)和强化学习(RL)是主导的训练范式,但如何系统性地将二者结合以最大化精度和效率却鲜有探索。本文引入一种实用且有效的训练配方,战略性地将扩展 SFT 与来自在线推理(GRPO)的 RL 相结合。我们认为,这些方法发挥的是互补而非竞争的作用:长期 SFT 阶段首先将模型的精度推至极限,随后 GRPO 阶段显著提升 token 效率,同时保持该最佳性能。我们的实验表明,延长 SFT 至多 10 个 epoch 对于实现性能突破至关重要,GRPO 在此框架中的主要作用是优化解的长度。通过在具有挑战性基准测试上的顶级表现(包括在严格无泄漏的 AI数学竞赛(AIMO)中获得 2200 多支队伍的高排名),严格验证了我们配方的有效性。本工作为社区提供了一套经过实战检验的蓝图,用于开发既非凡准确又实用高效的数学推理器。为确保完全可复现并赋能未来研究,我们将在 https://github.com/analokmaus/kaggle-aimo2-fast-math-r1 发布我们的整个框架,包括所有代码、模型检查点和训练配置。

关键词

引用

@article{arxiv.2507.08267,
  title  = {A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning},
  author = {Hiroshi Yoshihara and Taiki Yamaguchi and Yuichi Inoue},
  journal= {arXiv preprint arXiv:2507.08267},
  year   = {2025}
}

备注

Presented at ICML 2025 Workshop on The second AI for MATH