中文

RL-CycleGAN:感知强化学习的仿真到现实迁移

机器人学 2020-06-17 v1 计算机视觉与模式识别 机器学习

摘要

基于深度神经网络的强化学习(RL)能够为复杂任务(如基于视觉的机器人抓取)学习适当的视觉表征,而无需手动设计或预先学习感知系统。然而,强化学习的数据是通过在目标环境中运行智能体收集的,而对于机器人等应用,在真实世界中运行机器人可能极其昂贵且耗时。仿真训练提供了一种有吸引力的替代方案,但确保仿真中训练的策略能有效迁移到真实世界需要额外的机制。仿真可能与现实不匹配,而通常弥合仿真到现实差距需要领域知识和特定任务的工程。我们可以通过使用生成模型将仿真图像转换为真实图像来自动化这一过程。然而,这类转换通常是任务无关的,因为转换后的图像可能不保留与任务相关的所有特征。在本文中,我们引入了用于图像转换的 RL 场景一致性损失,其确保转换操作相对于与该图像相关的 Q 值是不变的。这使我们能够学习任务感知的转换。将该损失纳入无监督域转换,我们得到 RL-CycleGAN,一种用于强化学习的仿真到现实迁移的新方法。在两个基于视觉的机器人抓取任务上对 RL-CycleGAN 的评估中,我们表明 RL-CycleGAN 相较多种已有的 sim-to-real 迁移方法均有实质性改进,仅用少量真实世界观测即获得了优异的真实世界性能。

关键词

引用

@article{arxiv.2006.09001,
  title  = {RL-CycleGAN: Reinforcement Learning Aware Simulation-To-Real},
  author = {Kanishka Rao and Chris Harris and Alex Irpan and Sergey Levine and Julian Ibarz and Mohi Khansari},
  journal= {arXiv preprint arXiv:2006.09001},
  year   = {2020}
}

备注

Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2020)