不变变换经验回放:深度强化学习中的数据增强
机器人学
2020-08-27 v6 人工智能
机器学习
摘要
深度强化学习(RL)是一种有前景的自适应机器人控制方法,但其当前在机器人领域的应用受高样本需求阻碍。为缓解该问题,我们提议利用机器人任务中存在的对称性。直观上,来自观测轨迹的对称性定义了使可行RL轨迹空间保持不变的变换,并可用于生成新的可行轨迹以用于训练。基于该数据增强思想,我们 formulate 一个通用框架,称为不变变换经验回放,并以两种技术呈现:(i)万花筒经验回放利用反射对称性;(ii)目标增强经验回放利用宽松目标定义。在OpenAI Gym的Fetch任务中,实验结果显示学习速率与成功率显著提升。特别是在多目标设定下,我们在推动、滑动和拾放任务中分别获得13、3和5倍加速。在带障碍的类似任务中也观察到性能提升,并成功在真实Baxter机器人上部署训练策略。我们的工作表明,对RL轨迹的不变变换是加速深度RL学习的有前景方法。
引用
@article{arxiv.1909.10707,
title = {Invariant Transform Experience Replay: Data Augmentation for Deep Reinforcement Learning},
author = {Yijiong Lin and Jiancong Huang and Matthieu Zimmer and Yisheng Guan and Juan Rojas and Paul Weng},
journal= {arXiv preprint arXiv:1909.10707},
year = {2020}
}
备注
8 pages, 11 figures, additional 3 pages for appendix. IEEE Robotics and Automation Letters (RAL), 2020. Also in: Intelligent Robots and Systems (IROS)