中文

中心路径近端策略优化

机器学习 2025-08-18 v2

摘要

在约束马尔可夫决策过程中,训练期间施加约束通常被认为会降低最终回报。最近的研究表明,约束可以直接融入策略几何中,产生接近障碍法中心路径的优化轨迹,且不会损害最终回报。基于这一思想,我们提出了中心路径近端策略优化(Central Path Proximal Policy Optimization, C3PO),对 PPO 损失进行简单修改,使策略迭代保持在约束优化问题中心路径附近。与现有的同策略方法相比,C3PO 提供了更好的性能和更严格的约束执行,表明中心路径引导的更新为约束策略优化提供了一个有前景的方向。

关键词

引用

@article{arxiv.2506.00700,
  title  = {Central Path Proximal Policy Optimization},
  author = {Nikola Milosevic and Johannes Müller and Nico Scherf},
  journal= {arXiv preprint arXiv:2506.00700},
  year   = {2025}
}