中文

知位于何方之路:一种物体与房间感知的序列 BERT 用于室内视觉-语言导航

计算与语言 2021-08-26 v2 计算机视觉与模式识别

摘要

视觉-语言导航(VLN)要求智能体基于自然语言指令和一组照片级真实全景图找到通往远端位置的路径。大多数现有方法将指令中的单词与每个全景图的离散视角作为编码的最小单元。然而,这要求模型将不同名词(如电视、桌子)匹配到同一输入视角特征上。在本工作中,我们提出一种物体感知的序列 BERT,在相同的细粒度层级(即物体与单词)上编码视觉感知与语言指令。我们的序列 BERT 还使视觉-文本线索能够依据时间上下文进行解读,这对多轮 VLN 任务至关重要。此外,我们使模型能够识别每个可导航位置的相对方向(如左/右/前/后)及其当前与最终导航目标的房间类型(如卧室、厨房),因为此类信息在指令中广泛提及,暗示了期望的下一个与最终位置。我们由此使模型能够知道物体位于图像中何处,以及它们处于场景中的何处。大量实验证明了相较于若干最先进方法在三个室内 VLN 任务(REVERIE、NDH 和 R2R)上的有效性。项目仓库:https://github.com/YuankaiQi/ORIST

关键词

引用

@article{arxiv.2104.04167,
  title  = {The Road to Know-Where: An Object-and-Room Informed Sequential BERT for Indoor Vision-Language Navigation},
  author = {Yuankai Qi and Zizheng Pan and Yicong Hong and Ming-Hsuan Yang and Anton van den Hengel and Qi Wu},
  journal= {arXiv preprint arXiv:2104.04167},
  year   = {2021}
}

备注

Original title: Know What and Know Where: An Object-and-Room Informed Sequential BERT for Indoor Vision-Language Navigation