中文

视觉与语言导航中的可迁移表征学习

计算机视觉与模式识别 2019-08-14 v2 计算与语言 机器学习 机器人学

摘要

视觉与语言导航(VLN)任务如 Room-to-Room(R2R)要求机器智能体解释自然语言指令,并学习在视觉真实环境中行动以达成导航目标。整体任务要求具备若干感知问题的能力:成功的智能体结合时空、视觉与语言理解来产生恰当的动作序列。我们的方法将预训练的视觉与语言表征适配到相关的域内任务,使其对 VLN 更有效。具体而言,这些表征被适配以同时解决跨模态序列对齐与序列连贯性任务。在序列对齐任务中,模型判定一条指令是否对应于一段视觉帧序列。在序列连贯性任务中,模型判定在指令条件的潜空间中感知序列是否依次可预测。通过迁移域适配后的表征,我们改进了 R2R 中具竞争力的智能体,这由按路径长度加权的成功率(SPL)指标衡量。

关键词

引用

@article{arxiv.1908.03409,
  title  = {Transferable Representation Learning in Vision-and-Language Navigation},
  author = {Haoshuo Huang and Vihan Jain and Harsh Mehta and Alexander Ku and Gabriel Magalhaes and Jason Baldridge and Eugene Ie},
  journal= {arXiv preprint arXiv:1908.03409},
  year   = {2019}
}

备注

To appear in ICCV 2019