中文

PPO 在长链思维中崩溃的背后是什么?价值优化掌握着秘密

机器学习 2025-03-04 v1

摘要

强化学习(RL)对于使大语言模型(LLMs)能够为数学和推理等复杂任务生成长链思维(CoT)至关重要。然而,proximal policy optimization(PPO)在许多 RL 场景中有效,但在长 CoT 任务中却失败了。本文指出,价值初始化偏差和奖励信号衰减是 PPO 失败的根本原因。我们提出了 Value-Calibrated PPO(VC-PPO)来解决这些问题。在 VC-PPO 中,价值模型经过预训练以解决初始化偏差,且广义优势估计(GAE)的计算在演员和评论家之间解耦,以缓解奖励信号衰减。在美国邀请数学考试(AIME)上的实验表明,VC-PPO 显著提升了 PPO 的性能。消融研究表明,VC-PPO 中的技术对于增强 PPO 处理长 CoT 任务至关重要。

关键词

引用

@article{arxiv.2503.01491,
  title  = {What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret},
  author = {Yufeng Yuan and Yu Yue and Ruofei Zhu and Tiantian Fan and Lin Yan},
  journal= {arXiv preprint arXiv:2503.01491},
  year   = {2025}
}