实现细节在深度策略梯度中至关重要:以 PPO 与 TRPO 为例的研究
机器学习
2020-05-27 v1 机器人学
机器学习
摘要
我们通过案例研究两种流行算法——近端策略优化(Proximal Policy Optimization, PPO)和信赖域策略优化(Trust Region Policy Optimization, TRPO)——来探究深度策略梯度算法取得进展的根源。具体而言,我们考察了“代码级优化”的后果:这些算法增强仅在实现中出现,或作为核心算法的辅助细节被描述。看似次要,此类优化却对智能体行为产生了重大影响。我们的结果表明,它们(a)构成了 PPO 相对 TRPO 在累积奖励上大部分提升的原因,且(b)从根本上改变了 RL 方法的运作方式。这些洞见揭示了在深度强化学习中归因性能提升的困难与重要性。复现我们结果的代码见 https://github.com/MadryLab/implementation-matters。
引用
@article{arxiv.2005.12729,
title = {Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO},
author = {Logan Engstrom and Andrew Ilyas and Shibani Santurkar and Dimitris Tsipras and Firdaus Janoos and Larry Rudolph and Aleksander Madry},
journal= {arXiv preprint arXiv:2005.12729},
year = {2020}
}
备注
ICLR 2020 version. arXiv admin note: text overlap with arXiv:1811.02553