基于惩罚点概率距离的策略优化:近端策略优化的一种替代方法
机器学习
2019-02-15 v4 人工智能
机器学习
摘要
作为信赖域策略优化(TRPO)最成功的变体与改进,近端策略优化(PPO)已广泛应用于多个领域,具有数据利用率高、易于实现和良好并行性等优势。本文提出一种称为惩罚点概率距离策略优化(POP3D)的一阶梯度强化学习算法,它是总方差散度平方的下界,作为另一种强有力的变体。首先,我们讨论了几种常用算法的不足,我们的方法部分受此启发。其次,我们致力于通过应用POP3D克服这些不足。第三,我们从解流形的角度深入探究其机制。最后,我们基于通用基准在几种最先进算法间进行定量比较。仿真结果表明,POP3D与PPO相比极具竞争力。此外,我们的代码发布于 https://github.com/paperwithcode/pop3d。
引用
@article{arxiv.1807.00442,
title = {Policy Optimization With Penalized Point Probability Distance: An Alternative To Proximal Policy Optimization},
author = {Xiangxiang Chu},
journal= {arXiv preprint arXiv:1807.00442},
year = {2019}
}
备注
open source