中文

用于视觉与语言导航的邻视增强模型

计算机视觉与模式识别 2021-07-27 v3

摘要

视觉与语言导航(VLN)要求智能体通过遵循自然语言指令导航至目标位置。现有多数工作用候选点所在对应单视图的特征来表示导航候选。然而,指令可能提及单视图之外的地标作为参照,这可能导致现有方法的文本-视觉匹配失败。本工作中,我们提出一个多模块邻视增强模型(NvEM),自适应地融入来自邻视图的视觉上下文以改进文本-视觉匹配。具体而言,我们的 NvEM 利用主体模块和参照模块从邻视图收集上下文:主体模块在全局层面融合邻视图,参照模块在局部层面融合邻视物体。主体与参照通过注意力机制自适应确定。我们的模型还包含动作模块以利用指令中强方向引导(如“向左转”)。各模块分别预测导航动作,其加权和用于预测最终动作。大量实验结果表明,所提方法在 R2R 和 R4R 基准上相对于若干最优导航器有效,且 NvEM 甚至击败了一些预训练导航器。我们的代码见 https://github.com/MarSaKi/NvEM。

关键词

引用

@article{arxiv.2107.07201,
  title  = {Neighbor-view Enhanced Model for Vision and Language Navigation},
  author = {Dong An and Yuankai Qi and Yan Huang and Qi Wu and Liang Wang and Tieniu Tan},
  journal= {arXiv preprint arXiv:2107.07201},
  year   = {2021}
}