中文

利用跨模态表征学习用于空中导航的视觉运动策略

计算机视觉与模式识别 2020-03-10 v2 机器人学

摘要

机器在鲁棒解决开放世界感知-控制任务(如第一人称视角(FPV)空中导航)方面仍有很长的路要走。尽管端到端机器学习的最新进展,尤其是模仿学习和强化学习看起来很有前景,但它们受限于需要大量难以收集的标注真实世界数据。另一方面,模拟数据易于生成,但通常无法在多样的真实生活场景中产生安全行为。在这项工作中,我们提出了一种用于真实世界部署的鲁棒视觉运动策略学习新方法,该方法可完全使用模拟数据进行训练。我们开发了结合有监督和无监督环境数据的丰富状态表征。我们的方法采用跨模态视角,其中不同模态对应于原始相机数据和与任务相关的系统状态,例如无人机竞速中闸门相对于无人机的位姿。我们将两种数据模态输入到一个新颖的因子化架构中,该架构通过变分自编码器学习联合低维嵌入。然后将该紧凑表征输入到控制策略中,我们使用模拟器中的专家轨迹通过模仿学习对其进行了训练。我们分析了用我们提出的表征学习到的丰富潜空间,并表明与端到端学习或纯无监督特征提取器相比,使用我们的跨模态架构显著提升了控制策略性能。我们还展示了在不同赛道配置和环境条件下无人机穿门导航的真实世界结果。我们提出的方法完全在机载运行,能够成功地将学习到的表征和策略在模拟与现实中泛化,显著优于基线方法。补充视频:https://youtu.be/VKc3A5HlUU8

关键词

引用

@article{arxiv.1909.06993,
  title  = {Learning Visuomotor Policies for Aerial Navigation Using Cross-Modal Representations},
  author = {Rogerio Bonatti and Ratnesh Madaan and Vibhav Vineet and Sebastian Scherer and Ashish Kapoor},
  journal= {arXiv preprint arXiv:1909.06993},
  year   = {2020}
}