中文

AceReason-Nemotron:通过强化学习提升数学与代码推理能力

计算机视觉与模式识别 2025-05-23 v1

摘要

尽管近期在大规模强化学习(RL)用于推理方面取得了进展,但构建高性能推理模型的训练配方仍然含糊不清。诸如DeepSeek-R1等前沿模型的关键实现细节,包括数据 curated策略和RL训练配方,往往被省略。此外,近期研究表明,提炼(distillation)仍比RL对较小模型更有效。在本工作中,我们证明大规模RL可以显著提升强大、小型或中型模型的推理能力,取得优于基于提炼的SOTA模型的结果。我们通过大量消除实验系统研究RL训练过程,并提出一种简单而有效的方法:首先在数学-only提示下训练,然后在代码-only提示下训练。值得注意的是,数学-only RL不仅在数学基准(例如,对于7B/14B模型,在AIME 2025上分别提升+14.6%/+17.2%)中显著提升了强大的提炼模型性能,还在代码推理任务中产生效果(例如,对于7B/14B模型,在LiveCodeBench上分别提升+6.8%/+5.8%)。此外,进一步的code-only RL迭代可在代码基准上获得更好性能,同时对数学结果影响最小或不存在。我们构建了稳健的数据 curated管道,以收集具有高质量、可验证答案和测试用例的具有挑战性的提示,从而在两个领域中实现基于验证的RL。最后,我们识别出关键实验见解,包括逐步增加响应长度的课程学习以及基于on-policy参数更新的稳定效应。我们发现,RL不仅能激发在预训练和监督微调(例如,提炼)中获得的基础推理能力,还能推动模型推理能力的极限,使其能够解决此前无法解决的问题。

关键词

引用

@article{arxiv.2505.16399,
  title  = {Sketchy Bounding-box Supervision for 3D Instance Segmentation},
  author = {Qian Deng and Le Hui and Jin Xie and Jian Yang},
  journal= {arXiv preprint arXiv:2505.16399},
  year   = {2025}
}

备注

Accepted by CVPR 2025