VAPO:面向高级推理任务的高效可靠强化学习方法
人工智能
2025-04-14 v3
摘要
我们提出VAPO,即基于价值增强型近似政策优化框架(Value-based Augmented Proximal Policy Optimization),为推理模型设计的新型框架。该框架基于Qwen 32B预训练模型,在AIME 2024数据集上实现了的领先成绩。在相同的实验设置下,VAPO显著优于DeepSeek-R1-Zero-Qwen-32B和DAPO报告的结果,提升超过10分。VAPO的训练过程在稳定性和效率方面均表现突出,仅需5,000步即可达到领先水平。此外,经过多次独立实验验证,未出现任何训练崩溃,凸显了其可靠性。本研究在价值基强化学习框架下探讨了长链条推理(long-CoT)任务。我们指出价值方法面临的三大关键挑战:价值模型偏差、异构序列长度的存在以及奖励信号的稀疏性。通过系统化设计,VAPO提供了一整套解决方案,有效缓解了这些挑战,提升了长链条推理任务的性能。
引用
@article{arxiv.2504.05118,
title = {VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks},
author = {Yu Yue and Yufeng Yuan and Qiying Yu and Xiaochen Zuo and Ruofei Zhu and Wenyuan Xu and Jiaze Chen and Chengyi Wang and TianTian Fan and Zhengyin Du and Xiangpeng Wei and Xiangyu Yu and Gaohong Liu and Juncai Liu and Lingjun Liu and Haibin Lin and Zhiqi Lin and Bole Ma and Chi Zhang and Mofan Zhang and Wang Zhang and Hang Zhu and Ru Zhang and Xin Liu and Mingxuan Wang and Yonghui Wu and Lin Yan},
journal= {arXiv preprint arXiv:2504.05118},
year = {2025}
}