截断型近端策略优化
人工智能
2025-06-19 v1
摘要
最近,测试时扩展的大型语言模型(LLM)通过生成长链式思维(CoT),在科学和专业任务中展现出卓越的推理能力。作为开发这些推理模型的关键组件,强化学习(RL),以近端策略优化(PPO)及其变体为例,使模型能够通过试错学习。然而,PPO由于其内在的基于策略的特性,可能需要较长时间,尤其当响应长度增加时。这一问题更加突出。本文提出了截断型近端策略优化(T-PPO),这是一种对PPO的新型扩展,通过简化策略更新和长度受限的响应生成来提高训练效率。T-PPO缓解了完全同步长生成程序中硬件利用率低下的问题——在等待完整 rollout 完成期间,资源常常闲置。我们的贡献有两方面:第一,我们提出了扩展广义优势估计(EGAE),用于来自不完整响应的优势估计,同时保持策略学习的完整性。第二,我们设计了一种计算优化机制,允许策略模型和价值模型独立优化。通过有选择地过滤提示和截断标记,该机制减少了冗余计算,加快训练过程,同时不损害收敛性能。我们在32B基础模型上对AIME 2024上的实验表明,T-PPO提升了推理LLM的训练效率,可达2.5倍,且优于现有竞争方法。
引用
@article{arxiv.2506.15050,
title = {Truncated Proximal Policy Optimization},
author = {Tiantian Fan and Lingjun Liu and Yu Yue and Jiaze Chen and Chengyi Wang and Qiying Yu and Chi Zhang and Zhiqi Lin and Ruofei Zhu and Yufeng Yuan and Xiaochen Zuo and Bole Ma and Mofan Zhang and Gaohong Liu and Ru Zhang and Haotian Zhou and Cong Xie and Ruidong Zhu and Zhi Zhang and Xin Liu and Mingxuan Wang and Lin Yan and Yonghui Wu},
journal= {arXiv preprint arXiv:2506.15050},
year = {2025}
}