中文

重新审视近端策略优化中的设计选择

机器学习 2020-09-24 v1 机器学习

摘要

近端策略优化(PPO)是一种流行的深度策略梯度算法。在标准实现中,PPO通过裁剪概率比来正则化策略更新,并将策略参数化为连续高斯分布或离散Softmax分布。这些设计选择被广泛接受,并由MuJoCo和Atari基准上的经验性能比较所推动。我们在当前基准之外的场景中重新审视这些做法,并揭示了标准PPO的三种失效模式。我们解释了为何标准设计选择在这些情况下存在问题,并展示了替代的代理目标和策略参数化选择可防止这些失效模式。我们希望我们的工作能提醒人们,强化学习中的许多算法设计选择是与特定仿真环境绑定的。我们不应想当然地将这些选择作为更通用算法标准的一部分。

关键词

引用

@article{arxiv.2009.10897,
  title  = {Revisiting Design Choices in Proximal Policy Optimization},
  author = {Chloe Ching-Yun Hsu and Celestine Mendler-Dünner and Moritz Hardt},
  journal= {arXiv preprint arXiv:2009.10897},
  year   = {2020}
}