近端策略梯度:带策略梯度的 PPO
机器学习
2020-10-21 v1 人工智能
摘要
在本文中,我们提出一种新算法 PPG(Proximal Policy Gradient,近端策略梯度),它接近于 VPG(vanilla policy gradient,朴素策略梯度)和 PPO(proximal policy optimization,近端策略优化)。PPG 目标是 VPG 目标的部分变体,且 PPG 目标的梯度与 VPG 目标的梯度完全相同。为了增加策略更新迭代次数,我们引入优势-策略平面并设计了一种新的裁剪策略。我们在 OpenAI Gym 和 Bullet 机器人环境中使用十个随机种子进行了实验。PPG 的性能与 PPO 相当,且其熵衰减慢于 PPG。因此我们表明,通过使用原始策略梯度定理中的梯度公式,可以获得与 PPO 相似的性能。
引用
@article{arxiv.2010.09933,
title = {Proximal Policy Gradient: PPO with Policy Gradient},
author = {Ju-Seung Byun and Byungmoon Kim and Huamin Wang},
journal= {arXiv preprint arXiv:2010.09933},
year = {2020}
}
备注
7 pages