中文

GeoVLN:基于槽注意力学习几何增强视觉表征的视觉语言导航方法

计算机视觉与模式识别 2023-10-03 v2

摘要

大多数解决 Room-to-Room VLN 问题的现有工作仅利用 RGB 图像,未考虑候选视角周围的局部上下文,缺乏关于周围环境的充分视觉线索。此外,自然语言包含复杂的语义信息,因此其与视觉输入的关联难以仅通过交叉注意力建模。本文提出 GeoVLN,其基于槽注意力学习几何增强的视觉表征,以实现鲁棒的视觉语言导航。RGB 图像由 Omnidata 预测的深度图和法线图作为补充视觉输入。在技术上,我们引入一个两阶段模块,结合局部槽注意力与 CLIP 模型,从此类输入中生成几何增强表征。我们采用 V&L BERT 学习融合语言与视觉信息的跨模态表征。此外,设计了一种新颖的多路注意力模块,促使输入指令的不同短语利用视觉输入中最相关的特征。大量实验证明了我们新设计模块的有效性,并展示了所提方法的优异性能。

关键词

引用

@article{arxiv.2305.17102,
  title  = {GeoVLN: Learning Geometry-Enhanced Visual Representation with Slot Attention for Vision-and-Language Navigation},
  author = {Jingyang Huo and Qiang Sun and Boyan Jiang and Haitao Lin and Yanwei Fu},
  journal= {arXiv preprint arXiv:2305.17102},
  year   = {2023}
}

备注

Accepted by CVPR 2023