中文

简单策略优化

机器学习 2025-07-29 v9

摘要

无模型强化学习算法取得了显著进展,但关键挑战依然存在。信任域策略优化(TRPO)以其通过在信任域内进行保守更新来确保单调策略改进而闻名,并有强大的理论保证。然而,其对复杂二阶优化的依赖限制了其实用效率。近端策略优化(PPO)通过使用比率裁剪简化了TRPO的方法,提高了效率,但牺牲了一些理论上的鲁棒性。这引出了一个自然的问题:我们能否结合两种方法的优势?在本文中,我们介绍了简单策略优化(SPO),一种新颖的无约束一阶算法。通过略微修改PPO中使用的策略损失,SPO可以实现两全其美。我们的新目标改进了比率裁剪,提供了更强的理论性质,并更好地将概率比约束在信任域内。实证结果表明,SPO通过简单的实现优于PPO,特别是在端到端训练大型复杂网络架构时。

关键词

引用

@article{arxiv.2401.16025,
  title  = {Simple Policy Optimization},
  author = {Zhengpeng Xie and Qiang Zhang and Fan Yang and Marco Hutter and Renjing Xu},
  journal= {arXiv preprint arXiv:2401.16025},
  year   = {2025}
}