中文

一种用于训练导航策略并实现仿真到现实迁移的数据高效框架

机器人学 2018-10-12 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

纯粹从数据中学习机器人有效的视觉运动策略具有挑战性,但也很有吸引力,因为基于学习的系统不应需要手动调参或校准。对于在真实环境中运行的机器人,训练过程可能代价高昂、耗时,甚至在训练初期失败频发而存在危险。因此,希望尽可能利用仿真与离策略数据来训练机器人。在本工作中,我们引入了一个在仿真中规划并能良好迁移到真实环境的鲁棒框架。我们的模型包含一个基于梯度下降的规划模块,该模块在给定初始图像与目标图像时,将图像编码为低维隐状态并规划到达目标的轨迹。由编码器与规划器模块组成的模型,首先在仿真中通过元学习策略进行训练。随后,我们利用来自仿真与真实环境的一批无标签随机图像,对编码器进行对抗域迁移,使编码器能将真实与仿真环境的图像映射到分布相似的隐表示。通过使用远少于真实世界的专家演示对整体模型(编码器+规划器)进行微调,我们在不同导航任务中展示了成功的规划性能。

关键词

引用

@article{arxiv.1810.04871,
  title  = {A Data-Efficient Framework for Training and Sim-to-Real Transfer of Navigation Policies},
  author = {Homanga Bharadhwaj and Zihan Wang and Yoshua Bengio and Liam Paull},
  journal= {arXiv preprint arXiv:1810.04871},
  year   = {2018}
}

备注

Under review in ICRA 2019