中文

AceReason-Nemotron 1.1:通过SFT与RL协同推进数学与代码推理

计算与语言 2025-06-17 v1 人工智能 机器学习

摘要

在本文中,我们研究了监督微调与强化学习在开发强推理模型中的协同作用。我们首先通过两种扩展策略对SFT训练数据进行整理:增加收集的提示数量和每个提示生成的响应数量。两种方法均在推理性能上取得了显著提升,其中增加提示数量带来了更大幅度的改进。随后,我们探讨了以下关于SFT与RL协同作用的问题:(i) 更强的SFT模型是否始终在大规模RL训练后带来更好的最终性能?(ii) 如何确定RL训练中的适当采样温度,以有效平衡给定SFT初始化的探索与利用?我们的研究表明,(i) 成立,前提是进行了有效的RL训练,特别是当采样温度被精心选择以将温度调整后的熵维持在约0.3时,这一设置在探索与利用之间取得了良好平衡。值得注意的是,初始SFT模型之间的性能差距在RL过程中显著缩小。利用强大的SFT基础和对SFT与RL协同作用的洞察,我们的AceReason-Nemotron-1.1 7B模型显著优于AceReason-Nemotron-1.0,并在具有挑战性的数学和代码基准测试中取得了Qwen2.5-7B推理模型的新最先进性能,从而证明了我们后训练方案的有效性。我们在 https://huggingface.co/nvidia/AceReason-Nemotron-1.1-7B 发布模型和数据。

关键词

引用

@article{arxiv.2506.13284,
  title  = {AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy},
  author = {Zihan Liu and Zhuolin Yang and Yang Chen and Chankyu Lee and Mohammad Shoeybi and Bryan Catanzaro and Wei Ping},
  journal= {arXiv preprint arXiv:2506.13284},
  year   = {2025}
}

备注

The AceReason-Nemotron collection: https://huggingface.co/collections/nvidia/acereason-682f4e1261dc22f697fd1485