中文

BEVBert:用于语言引导导航的多模态地图预训练

计算机视觉与模式识别 2023-08-04 v2 人工智能 计算与语言 机器人学

摘要

大规模预训练在视觉与语言导航(VLN)任务上已展现出有前景的结果。然而,大多数现有预训练方法采用离散全景图来学习视觉-文本关联。这要求模型隐式地关联全景图中不完整、重复的观测,可能损害智能体的空间理解。因此,我们提出了一种用于 VLN 的、具有空间感知的、基于地图的新预训练范式。具体而言,我们构建局部度量地图以显式聚合不完整观测并去除重复,同时在全局拓扑地图中建模导航依赖。这种混合设计能平衡 VLN 对短期推理与长期规划的需求。然后,基于该混合地图,我们设计了一个预训练框架来学习多模态地图表示,从而增强空间感知的跨模态推理,进而促进语言引导导航目标。大量实验证明了基于地图的预训练路径对 VLN 的有效性,且所提方法在四个 VLN 基准上达到了最先进水平(state-of-the-art)。

关键词

引用

@article{arxiv.2212.04385,
  title  = {BEVBert: Multimodal Map Pre-training for Language-guided Navigation},
  author = {Dong An and Yuankai Qi and Yangguang Li and Yan Huang and Liang Wang and Tieniu Tan and Jing Shao},
  journal= {arXiv preprint arXiv:2212.04385},
  year   = {2023}
}

备注

ICCV 2023, project page: https://github.com/MarSaKi/VLN-BEVBert