中文

PCL-Reasoner-V1.5:基于离线强化学习提升数学推理能力

机器学习 2026-01-22 v1 人工智能 计算与语言

摘要

我们提出了 PCL-Reasoner-V1.5,这是一个320亿参数的大型语言模型(LLM),用于数学推理。该模型基于 Qwen2.5-32B 进行监督微调(SFT)后,再通过强化学习(RL)进行细化。核心创新点在于我们提出的离线 RL 方法,相较于标准的在线 RL 方法(如 GRPO)在训练稳定性和效率方面表现更优。我们的模型在基于 Qwen2.5-32B 的后训练模型中实现了最先进的性能,AIME 2024 和 AIME 2025 的平均准确率分别达到 90.9% 和 85.6%。我们的工作表明,离线 RL 作为推进 LLM 推理能力的稳定且高效的范式。所有实验均在华为 Ascend 910C NPU 上完成。

关键词

引用

@article{arxiv.2601.14716,
  title  = {PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning},
  author = {Yao Lu and Dengdong Fan and Jianzheng Nie and Fan Xu and Jie Chen and Bin Zhou and Yonghong Tian},
  journal= {arXiv preprint arXiv:2601.14716},
  year   = {2026}
}