GeoVLN:基于槽注意力学习几何增强视觉表征的视觉语言导航方法
计算机视觉与模式识别
2023-10-03 v2
摘要
大多数解决 Room-to-Room VLN 问题的现有工作仅利用 RGB 图像,未考虑候选视角周围的局部上下文,缺乏关于周围环境的充分视觉线索。此外,自然语言包含复杂的语义信息,因此其与视觉输入的关联难以仅通过交叉注意力建模。本文提出 GeoVLN,其基于槽注意力学习几何增强的视觉表征,以实现鲁棒的视觉语言导航。RGB 图像由 Omnidata 预测的深度图和法线图作为补充视觉输入。在技术上,我们引入一个两阶段模块,结合局部槽注意力与 CLIP 模型,从此类输入中生成几何增强表征。我们采用 V&L BERT 学习融合语言与视觉信息的跨模态表征。此外,设计了一种新颖的多路注意力模块,促使输入指令的不同短语利用视觉输入中最相关的特征。大量实验证明了我们新设计模块的有效性,并展示了所提方法的优异性能。
引用
@article{arxiv.2305.17102,
title = {GeoVLN: Learning Geometry-Enhanced Visual Representation with Slot Attention for Vision-and-Language Navigation},
author = {Jingyang Huo and Qiang Sun and Boyan Jiang and Haitao Lin and Yanwei Fu},
journal= {arXiv preprint arXiv:2305.17102},
year = {2023}
}
备注
Accepted by CVPR 2023