中文

实现细节在深度策略梯度中至关重要:以 PPO 与 TRPO 为例的研究

机器学习 2020-05-27 v1 机器人学 机器学习

摘要

我们通过案例研究两种流行算法——近端策略优化(Proximal Policy Optimization, PPO)和信赖域策略优化(Trust Region Policy Optimization, TRPO)——来探究深度策略梯度算法取得进展的根源。具体而言,我们考察了“代码级优化”的后果:这些算法增强仅在实现中出现,或作为核心算法的辅助细节被描述。看似次要,此类优化却对智能体行为产生了重大影响。我们的结果表明,它们(a)构成了 PPO 相对 TRPO 在累积奖励上大部分提升的原因,且(b)从根本上改变了 RL 方法的运作方式。这些洞见揭示了在深度强化学习中归因性能提升的困难与重要性。复现我们结果的代码见 https://github.com/MadryLab/implementation-matters。

关键词

引用

@article{arxiv.2005.12729,
  title  = {Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO},
  author = {Logan Engstrom and Andrew Ilyas and Shibani Santurkar and Dimitris Tsipras and Firdaus Janoos and Larry Rudolph and Aleksander Madry},
  journal= {arXiv preprint arXiv:2005.12729},
  year   = {2020}
}

备注

ICLR 2020 version. arXiv admin note: text overlap with arXiv:1811.02553