基于自监督辅助推理任务的视觉-语言导航
计算机视觉与模式识别
2020-04-02 v4
摘要
视觉-语言导航(VLN)是一个智能体学习遵循自然语言指令进行导航的任务。该任务的关键是按顺序感知视觉场景和自然语言。常规方法在跨模态接地中利用视觉和语言特征。然而,VLN 任务仍然具有挑战性,因为先前的工作忽视了环境中包含的丰富语义信息(如隐式导航图或子轨迹语义)。在本文中,我们引入辅助推理导航(AuxRN),一个具有四个自监督辅助推理任务的框架,以利用从语义信息导出的额外训练信号。辅助任务有四个推理目标:解释先前的动作、估计导航进度、预测下一个朝向以及评估轨迹一致性。因此,这些额外的训练信号帮助智能体获取语义表示的知识的以推理其活动并建立对环境的透彻感知。我们的实验表明,辅助推理任务大幅提高了主任务的性能和模型的泛化能力。凭经验,我们证明用自监督辅助推理任务训练的智能体大幅优于先前的最先进方法,是标准基准上现有最佳方法。
引用
@article{arxiv.1911.07883,
title = {Vision-Language Navigation with Self-Supervised Auxiliary Reasoning Tasks},
author = {Fengda Zhu and Yi Zhu and Xiaojun Chang and Xiaodan Liang},
journal= {arXiv preprint arXiv:1911.07883},
year = {2020}
}