中文

近端策略梯度:带策略梯度的 PPO

机器学习 2020-10-21 v1 人工智能

摘要

在本文中,我们提出一种新算法 PPG(Proximal Policy Gradient,近端策略梯度),它接近于 VPG(vanilla policy gradient,朴素策略梯度)和 PPO(proximal policy optimization,近端策略优化)。PPG 目标是 VPG 目标的部分变体,且 PPG 目标的梯度与 VPG 目标的梯度完全相同。为了增加策略更新迭代次数,我们引入优势-策略平面并设计了一种新的裁剪策略。我们在 OpenAI Gym 和 Bullet 机器人环境中使用十个随机种子进行了实验。PPG 的性能与 PPO 相当,且其熵衰减慢于 PPG。因此我们表明,通过使用原始策略梯度定理中的梯度公式,可以获得与 PPO 相似的性能。

关键词

引用

@article{arxiv.2010.09933,
  title  = {Proximal Policy Gradient: PPO with Policy Gradient},
  author = {Ju-Seung Byun and Byungmoon Kim and Huamin Wang},
  journal= {arXiv preprint arXiv:2010.09933},
  year   = {2020}
}

备注

7 pages