中文

从YouTube视频中学习视觉与语言导航

计算机视觉与模式识别 2023-07-25 v1 计算与语言

摘要

视觉与语言导航(VLN)要求具身智能体使用自然语言指令在真实三维环境中导航。现有 VLN 方法受限于在小规模环境或不合理的路径-指令数据集上训练,限制了对未见环境的泛化能力。YouTube 上有大量房屋游览视频,提供了丰富的真实导航经验与布局信息。然而,这些视频此前尚未被探索用于 VLN。本文中,我们提出通过创建大规模数据集来从这些视频中学习智能体,该数据集由房屋游览视频中合理的路径-指令对组成,并在此上预训练智能体。为此,我们必须应对自动构建路径-指令对以及从原始无标签视频中挖掘真实布局知识的挑战。针对这些,我们首先利用基于熵的方法构建路径轨迹的节点。然后,我们提出一种动作感知生成器,用于从无标签轨迹生成指令。最后,我们设计了一个轨迹判断 pretext 任务以鼓励智能体挖掘布局知识。实验结果表明,我们的方法在两个流行基准(R2R 和 REVERIE)上达到了最先进的性能。代码见 https://github.com/JeremyLinky/YouTube-VLN

关键词

引用

@article{arxiv.2307.11984,
  title  = {Learning Vision-and-Language Navigation from YouTube Videos},
  author = {Kunyang Lin and Peihao Chen and Diwei Huang and Thomas H. Li and Mingkui Tan and Chuang Gan},
  journal= {arXiv preprint arXiv:2307.11984},
  year   = {2023}
}

备注

Accepted by ICCV 2023