中文

基于任务一致性损失的真实世界实用模仿学习

机器人学 2022-03-09 v2 机器学习

摘要

近期机器视觉端到端学习在机器人学中的工作已展现出模仿学习在多种任务上的前景。此类方法代价高昂,既因其需要大量真实世界训练演示,也因识别可部署于真实世界的最佳模型需耗费时间的真实世界评估。这些挑战可通过仿真缓解:以仿真演示补充真实数据,并利用仿真评估识别高性能策略。然而,这引入了众所周知的“现实鸿沟”问题,即仿真器的不准确性使仿真中的性能与真实性能去相关。本文在基于 GAN 的领域自适应已有工作之上,提出任务一致性损失(Task Consistency Loss, TCL)这一概念,一种在特征与动作预测层面均鼓励仿真与真实对齐的自监督损失。我们通过教导一台移动操纵器自主接近门、转动把手开门并进入房间来展示方法有效性。该策略从 RGB 与深度图像进行控制,并可泛化至训练数据中未遇到的门。仅使用仿真与真实中约 16.2 小时的遥操作演示,我们在十六个已见与未见过场景中取得了 72% 成功率。据我们所知,这是首项以纯端到端学习方法解决闩锁门开启的工作,其中导航与操纵任务由单一神经网络联合建模。

关键词

引用

@article{arxiv.2202.01862,
  title  = {Practical Imitation Learning in the Real World via Task Consistency Loss},
  author = {Mohi Khansari and Daniel Ho and Yuqing Du and Armando Fuentes and Matthew Bennice and Nicolas Sievers and Sean Kirmani and Yunfei Bai and Eric Jang},
  journal= {arXiv preprint arXiv:2202.01862},
  year   = {2022}
}