基于增强数据的强化学习
机器学习
2020-11-06 v5 机器学习
摘要
从视觉观测中学习是强化学习(RL)中一个基础但具有挑战性的问题。尽管算法进展与卷积神经网络相结合已被证明是成功的秘诀,当前方法在两个方面仍显不足:(a) 学习的数据效率与 (b) 对新环境的泛化能力。为此,我们提出基于增强数据的强化学习(RAD),一个可增强大多数 RL 算法的简单即插即用模块。我们对基于像素和基于状态的输入上 RL 的通用数据增强进行了首次广泛研究,并引入两种新数据增强——随机平移与随机振幅缩放。我们表明,随机平移、裁剪、颜色抖动、块遮掩、随机卷积和振幅缩放等增强能使简单 RL 算法在常见基准上胜过复杂的最先进方法。RAD 在基于像素控制的 DeepMind Control Suite 基准以及基于状态控制的 OpenAI Gym 基准上,就数据效率与最终性能设立了新的最先进水平。我们进一步证明,RAD 在若干 OpenAI ProcGen 基准上相较现有方法显著提升了测试时泛化能力。我们的 RAD 模块与训练代码可在 https://www.github.com/MishaLaskin/rad 获取。
引用
@article{arxiv.2004.14990,
title = {Reinforcement Learning with Augmented Data},
author = {Michael Laskin and Kimin Lee and Adam Stooke and Lerrel Pinto and Pieter Abbeel and Aravind Srinivas},
journal= {arXiv preprint arXiv:2004.14990},
year = {2020}
}
备注
NeurIPS 2020 camera-ready version. First two authors contributed equally, website: https://mishalaskin.github.io/rad code: https://github.com/MishaLaskin/rad and https://github.com/pokaxpoka/rad_procgen