中文

利用网络图文对改进视觉与语言导航

计算机视觉与模式识别 2020-05-04 v2 人工智能 计算与语言 机器学习

摘要

遵循诸如“走下楼梯并停在棕色沙发处”之类的导航指令,需要具身 AI 智能体将语言中引用的场景元素(如“楼梯”) grounding 到环境中的视觉内容(对应于“楼梯”的像素)。我们提出以下问题——我们能否利用丰富的“非具身”网络抓取视觉与语言语料库(例如 Conceptual Captions)来学习视觉 grounding(即“楼梯”长什么样?),从而提升在数据相对匮乏的具身感知任务(视觉与语言导航,VLN)上的表现?具体而言,我们开发了 VLN-BERT,一种基于视觉语言 transformer 的模型,用于对指令(“……停在棕色沙发处”)与智能体捕获的全景 RGB 图像序列之间的兼容性进行打分。我们证明,在具身路径-指令数据上微调之前,先在网络图文对上预训练 VLN-BERT,可显著提升 VLN 性能——在全观测设定下,成功率较先前最优(SOTA)方法绝对提升 4 个百分点。对我们预训练课程安排的消融实验表明每个阶段都有影响——它们的组合带来了进一步的积极协同效应。

关键词

引用

@article{arxiv.2004.14973,
  title  = {Improving Vision-and-Language Navigation with Image-Text Pairs from the Web},
  author = {Arjun Majumdar and Ayush Shrivastava and Stefan Lee and Peter Anderson and Devi Parikh and Dhruv Batra},
  journal= {arXiv preprint arXiv:2004.14973},
  year   = {2020}
}