中文

面向室内环境中长程组合任务的模块化视觉语言导航与操控框架

计算机视觉与模式识别 2021-01-21 v1 人机交互 机器人学

摘要

在本文中,我们提出一个新框架——MoViLan(模块化视觉与语言),用于执行以视觉为基础的自然语言指令,完成日常室内家务任务。尽管已有若干基于视觉和语言模态、针对特定导航任务的数据驱动端到端学习框架被提出,但近期基准数据集上的性能揭示了在开发面向长程、组合任务(涉及操控与导航)、具有多样物体类别、真实指令以及带有不可逆状态变化的视觉场景的综合技术方面仍存在差距。我们提出一种模块化方法来处理组合式导航与物体交互问题,且不需要严格对齐的视觉与语言训练数据(例如专家演示轨迹形式)。此方法显著不同于该领域的传统端到端技术,并允许使用独立的视觉和语言数据集进行更易处理的训练过程。具体而言,我们提出一种用于杂乱室内环境的新型几何感知建图技术,以及一种泛化用于家务指令跟随的语言理解模型。我们在近期发布的基准数据集 ALFRED 上,展示了相对于基线在长程、组合任务成功率上的显著提升。

关键词

引用

@article{arxiv.2101.07891,
  title  = {A modular vision language navigation and manipulation framework for long horizon compositional tasks in indoor environment},
  author = {Homagni Saha and Fateme Fotouhif and Qisai Liu and Soumik Sarkar},
  journal= {arXiv preprint arXiv:2101.07891},
  year   = {2021}
}

备注

16 pages