中文

rStar2-Agent:基于强化学习的智能体推理技术报告

计算与语言 2025-08-29 v1

摘要

我们介绍 rStar2-Agent,一个 14B 参数的数学推理模型,通过智能体强化学习训练,以实现前沿水平性能。超越当前的长链思维,模型展现出先进的认知行为,如在使用 Python 编码工具前仔细思考,并反思代码执行反馈以自主探索、验证和细化复杂问题解决中的中间步骤。这种能力通过三项关键创新实现:(i) 高效的 RL 基础设施,配备可靠的 Python 编码环境,支持高吞吐执行,减轻高 rollout 成本,使在有限 GPU 资源(64 台 MI300X)上训练成为可能;(ii) GRPO-RoC,即一种具备在正确 rollout 时重新抽样的智能体 RL 算法,解决编码工具固有的环境噪声问题,使模型在代码环境中更有效地推理;(iii) 高效的智能体训练配方,先进行非推理 SFT,然后经过多阶段 RL,即可以最小计算成本获得先进认知能力。鉴于此,rStar2-Agent 在仅 510 个 RL 步数、一周内将预训练的 14B 模型提升至 SOTA 水平,在 AIME24 和 AIME25 上实现平均 pass@1 分数分别为 80.6% 和 69.8%,超越 DeepSeek-R1(671B 参数),且响应更为简洁。除数学外,rStar2-Agent-14B 还在对齐、科学推理和智能体工具使用任务上表现出强大的泛化能力。代码和训练配方已提供于 https://github.com/microsoft/rStar。

关键词

引用

@article{arxiv.2508.20722,
  title  = {rStar2-Agent: Agentic Reasoning Technical Report},
  author = {Ning Shang and Yifei Liu and Yi Zhu and Li Lyna Zhang and Weijiang Xu and Xinyu Guan and Buze Zhang and Bingcheng Dong and Xudong Zhou and Bowen Zhang and Ying Xin and Ziming Miao and Scarlett Li and Fan Yang and Mao Yang},
  journal= {arXiv preprint arXiv:2508.20722},
  year   = {2025}
}