中文

AceReason-Nemotron:通过强化学习提升数学和代码推理能力

机器学习 2025-06-06 v3 人工智能 计算与语言

摘要

尽管近期在大规模强化学习(RL)用于推理方面取得了进展,但构建高性能推理模型的训练配方仍然尚不清晰。诸如DeepSeek-R1等前沿模型的关键实现细节,包括数据 curated 策略和 RL 训练配方,往往被省略。此外,近期研究表明,提炼仍比RL对小型模型更有效。在本工作中,我们展示了大规模RL可以显著提升强大、小型和中型模型的推理能力,取得超越当前基于提炼的SOTA模型的结果。我们通过大量消除实验系统地研究了RL训练过程,并提出一种简单而有效的方法:首先在数学-only 提示下训练,然后在代码-only 提示下训练。值得注意的是,数学-only RL不仅在数学基准测试中显著提升了强大提炼模型的性能(例如,对7B/14B模型在AIME 2025上分别提升+14.6%/+17.2%),也提升了代码推理任务的性能(例如,对7B/14B模型在LiveCodeBench上分别提升+6.8%/+5.8%)。此外,进一步的code-only RL迭代可在代码基准测试中获得性能提升,同时对数学结果影响最小或不存在。我们构建了稳健的数据 curated 管道,以收集具有高质量、可验证答案和测试用例的具有挑战性的提示,从而在两个领域中实现基于验证的RL。最后,我们确定了关键实验见解,包括逐步增加响应长度的课程学习以及基于on-policy参数更新的稳定效应。我们发现,RL不仅会激发在预训练和监督微调(例如提炼)期间获得的基础推理能力,还能推动模型推理能力的极限,使其能够解决此前无法解决的问题。

关键词

引用

@article{arxiv.2505.16400,
  title  = {AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning},
  author = {Yang Chen and Zhuolin Yang and Zihan Liu and Chankyu Lee and Peng Xu and Mohammad Shoeybi and Bryan Catanzaro and Wei Ping},
  journal= {arXiv preprint arXiv:2505.16400},
  year   = {2025}
}

备注

Add pass@1024 evaluation results for LiveCodeBench v6. We release the models at: https://huggingface.co/collections/nvidia/acereason-682f4e1261dc22f697fd1485