面向视觉机器人操作的自我监督仿真到真实自适应
机器人学
2019-10-22 v1 计算机视觉与模式识别
摘要
为训练强化学习算法而从真实机器人视觉数据中收集和自动获取奖励信号可能极具挑战且耗时。利用无标签数据的方法具有巨大潜力来进一步加速机器人学习。我们在此考虑从像素执行操作任务的问题。在此类任务中,选择合适的状态表示对于规划和控制至关重要。在真实图像中这一点更为相关,因为噪声、遮挡和分辨率会影响状态估计的准确性和可靠性。在这项工作中,我们在仿真中通过深度强化学习隐式学习潜在状态表示,然后使用无标签真实机器人数据将其适配到真实域。我们提议通过优化基于序列的自我监督目标来实现。这些方法利用了机器人经验的时间特性,并且可同时存在于仿真和真实域中,而不假设仿真和无标签真实图像中底层状态的对齐。我们提出对比前向动力学损失,其将动力学模型学习与时间对比技术相结合。由我们的方法得到的学习状态表示可用于鲁棒地在仿真中解决操作任务,并成功地将所学技能迁移到真实系统。我们通过训练一个基于视觉的强化学习智能体进行立方体堆叠来展示我们方法的有效性。使用我们的方法训练的智能体,仅利用5小时无标签真实机器人数据进行适配,相对于域随机化以及标准的视觉域适应技术用于仿真到真实迁移,显示出明显改进。
引用
@article{arxiv.1910.09470,
title = {Self-Supervised Sim-to-Real Adaptation for Visual Robotic Manipulation},
author = {Rae Jeong and Yusuf Aytar and David Khosid and Yuxiang Zhou and Jackie Kay and Thomas Lampe and Konstantinos Bousmalis and Francesco Nori},
journal= {arXiv preprint arXiv:1910.09470},
year = {2019}
}