面向视觉-语言导航的对比指令-轨迹学习
计算机视觉与模式识别
2021-12-10 v2 计算与语言
机器学习
摘要
视觉-语言导航(VLN)任务要求智能体在自然语言指令的引导下到达目标。先前的工作学习逐步遵循指令进行导航。然而,这些工作可能无法区分不同指令-轨迹对之间的相似性和差异性,并忽略了子指令的时间连续性。这些问题阻碍了智能体学习独特的视觉与语言表征,损害了导航策略的鲁棒性和泛化能力。在本文中,我们提出了一种对比指令-轨迹学习(CITL)框架,该框架探索相似数据样本间的不变性和不同样本间的差异性,以学习用于鲁棒导航的独特表征。具体来说,我们提出:(1)一个粗粒度对比学习目标,通过分别对比完整轨迹观察和指令的语义来增强视觉与语言表征;(2)一个细粒度对比学习目标,通过利用子指令的时间信息来感知指令;(3)一种用于对比学习的成对样本重加权机制,以挖掘难样本,从而减轻对比学习中数据采样偏差的影响。我们的 CITL 可以轻松集成到 VLN 主干网络中,形成新的学习范式,并在未见环境中实现更好的泛化能力。大量实验表明,采用 CITL 的模型在 R2R、R4R 和 RxR 数据集上超越了先前的最先进方法。
引用
@article{arxiv.2112.04138,
title = {Contrastive Instruction-Trajectory Learning for Vision-Language Navigation},
author = {Xiwen Liang and Fengda Zhu and Yi Zhu and Bingqian Lin and Bing Wang and Xiaodan Liang},
journal= {arXiv preprint arXiv:2112.04138},
year = {2021}
}
备注
Accepted by AAAI 2022