DDPG++:在连续控制离屏策略强化学习中追求简洁
机器学习
2020-06-30 v1 机器学习
摘要
本文提出一套用于离屏策略强化学习(RL)的技术,以简化训练过程并降低样本复杂度。首先,我们表明只要控制过高估计偏差,简单的确定性策略梯度就能表现极佳,这与现有文献中构建复杂离屏策略技术的做法相反。其次,我们将离屏策略算法典型的训练不稳定性归因于贪婪策略更新步骤;现有的如延迟策略更新等方案并未缓解此问题。第三,我们表明倾向估计文献中的思想可用于对回放缓冲区中的转移进行重要性采样,并有选择地更新策略以防止性能退化。我们在一组具有挑战性的 MuJoCo 任务上通过大量实验证实了这些主张。我们结果的简短视频可见 https://tinyurl.com/scs6p5m 。
引用
@article{arxiv.2006.15199,
title = {DDPG++: Striving for Simplicity in Continuous-control Off-Policy Reinforcement Learning},
author = {Rasool Fakoor and Pratik Chaudhari and Alexander J. Smola},
journal= {arXiv preprint arXiv:2006.15199},
year = {2020}
}