中文

视觉与语言导航:在真实环境中解读视觉基础的导航指令

计算机视觉与模式识别 2018-04-09 v3 人工智能 计算与语言 机器人学

摘要

能够执行自然语言指令的机器人自Jetsons卡通系列设想由一群周到机器人助手调解的休闲生活之前便已是梦想。这一梦想仍顽固地遥远。然而,视觉与语言方法的近期进展在紧密相关领域取得了惊人进步。这具有重要意义,因为机器人基于其所见解读自然语言导航指令,正执行着类似于视觉问答(VQA)的视觉与语言过程。两项任务均可解释为视觉基础的序列到序列翻译问题,且许多相同方法适用。为促成并鼓励视觉与语言方法应用于解读视觉基础导航指令的问题,我们提出Matterport3D模拟器——一种基于真实图像的大规模强化学习环境。利用该模拟器(未来可支持一系列具身视觉与语言任务),我们提供了真实建筑中视觉基础自然语言导航的首个基准数据集——Room-to-Room (R2R)数据集。

关键词

引用

@article{arxiv.1711.07280,
  title  = {Vision-and-Language Navigation: Interpreting visually-grounded navigation instructions in real environments},
  author = {Peter Anderson and Qi Wu and Damien Teney and Jake Bruce and Mark Johnson and Niko Sünderhauf and Ian Reid and Stephen Gould and Anton van den Hengel},
  journal= {arXiv preprint arXiv:1711.07280},
  year   = {2018}
}

备注

CVPR 2018 Spotlight presentation