Parallel-R1:面向平行思维的强化学习方法
计算与语言
2025-09-15 v2
摘要
平行思维(parallel thinking)已被提出作为一种新型方法,通过并行探索多个推理路径来增强大型语言模型(LLM)的推理能力。然而,如何通过训练激活这种能力仍然具有挑战性,因为现有方法主要依赖于针对合成数据的监督微调(SFT),这会导致教师强制的模仿,而非探索和泛化。与此不同,我们提出了 Parallel-R1——首个能够为复杂现实推理任务启用平行思维行为的强化学习(RL)框架。该框架采用渐进式课程设计,显式解决 RL 训练中平行思维的冷启动问题。我们首先对来自更简单任务中生成的轨迹进行 SFT,以培养平行思维能力;随后再过渡到 RL,在更难的问题上进行探索与泛化。在包括 MATH、AMC23 和 AIME 在内的多个数学基准测试中实验结果表明,Parallel-R1 成功培养了平行思维能力,相较于直接在困难任务上进行 RL 训练的顺序思维模型,准确率提升了 8.4%。进一步分析显示,模型思维行为呈现明显转变:在早期阶段,它将平行思维用作探索策略;而在后期阶段,它则使用同一能力进行多视角验证。最重要的是,我们验证了平行思维作为一种“中期训练探索脚手架”,即这一临时性探索阶段可在 RL 之后解锁更高的性能上限,在 AIME25 上实现了相对于基线的 42.9% 的提升。我们的模型、数据和代码将在 https://github.com/zhengkid/Parallel-R1 上开源。
引用
@article{arxiv.2509.07980,
title = {Parallel-R1: Towards Parallel Thinking via Reinforcement Learning},
author = {Tong Zheng and Hongming Zhang and Wenhao Yu and Xiaoyang Wang and Runpeng Dai and Rui Liu and Huiwen Bao and Chengsong Huang and Heng Huang and Dong Yu},
journal= {arXiv preprint arXiv:2509.07980},
year = {2025}
}
备注
Project website: https://zhengkid.github.io/Parallel_R1.github.io/