HOP:面向视觉语言导航的历史与顺序感知预训练
计算机视觉与模式识别
2022-03-23 v1 计算与语言
摘要
预训练已被近期的一些视觉语言导航(VLN)工作所采用。然而,以往的 VLN 预训练方法要么缺乏预测未来动作的能力,要么忽略了轨迹上下文,而这对于贪心导航过程至关重要。在这项工作中,为了促进时空视觉-文本对应关系的学习以及智能体的决策能力,我们提出了一种新颖的历史与顺序感知预训练范式(HOP),其具有利用过去观测并支持未来动作预测的 VLN 特定目标。具体而言,除了常用的掩码语言建模(MLM)和轨迹-指令匹配(TIM)之外,我们还设计了两个代理任务来建模时间顺序信息:轨迹顺序建模(TOM)和组顺序建模(GOM)。此外,我们的导航动作预测还通过引入带有历史的动作预测(APH)任务得到了增强,该任务考虑了历史视觉感知。在四个下游 VLN 任务(R2R、REVERIE、NDH、RxR)上的大量实验结果证明了我们提出的方法相较于几种 SOTA 智能体的有效性。
引用
@article{arxiv.2203.11591,
title = {HOP: History-and-Order Aware Pre-training for Vision-and-Language Navigation},
author = {Yanyuan Qiao and Yuankai Qi and Yicong Hong and Zheng Yu and Peng Wang and Qi Wu},
journal= {arXiv preprint arXiv:2203.11591},
year = {2022}
}