中文

一种近似攀升方法用于证明 PPO 的收敛性

机器学习 2026-02-04 v1 人工智能 最优化与控制

摘要

近距离策略优化 (PPO) 是目前最广泛使用的深度强化学习算法之一,但其理论基础仍不完整。最重要的是,PPO 的收敛性和基本优势的理解仍然广为人知。在标准理论假设下,我们展示了 PPO 的策略更新方案(在具有多次使用的 rollout 上进行多个小批量更新的代理梯度)如何可被解释为近似策略梯度攀升。我们展示了如何控制代理梯度积累的偏差,并使用随机重洗技术为 PPO 证明一个收敛定理,阐明了 PPO 成功的原因。此外,我们识别出在 PPO 中常用的截断广义优势估计中存在的一个被忽视的问题。几何加权方案在剧集边界处导致最长 kk 步优势估计器上的无限质量坍缩。经验评估显示,一个简单的权重校正可以在具有强终端信号的环境中(如 Lunar Lander)获得显著的性能改进。

关键词

引用

@article{arxiv.2602.03386,
  title  = {An Approximate Ascent Approach To Prove Convergence of PPO},
  author = {Leif Doering and Daniel Schmidt and Moritz Melcher and Sebastian Kassing and Benedikt Wille and Tilman Aach and Simon Weissmann},
  journal= {arXiv preprint arXiv:2602.03386},
  year   = {2026}
}