中心路径近端策略优化
机器学习
2025-08-18 v2
摘要
在约束马尔可夫决策过程中,训练期间施加约束通常被认为会降低最终回报。最近的研究表明,约束可以直接融入策略几何中,产生接近障碍法中心路径的优化轨迹,且不会损害最终回报。基于这一思想,我们提出了中心路径近端策略优化(Central Path Proximal Policy Optimization, C3PO),对 PPO 损失进行简单修改,使策略迭代保持在约束优化问题中心路径附近。与现有的同策略方法相比,C3PO 提供了更好的性能和更严格的约束执行,表明中心路径引导的更新为约束策略优化提供了一个有前景的方向。
关键词
引用
@article{arxiv.2506.00700,
title = {Central Path Proximal Policy Optimization},
author = {Nikola Milosevic and Johannes Müller and Nico Scherf},
journal= {arXiv preprint arXiv:2506.00700},
year = {2025}
}