视觉与语言导航中的多视角学习
计算与语言
2020-03-11 v3 计算机视觉与模式识别
机器学习
摘要
学习在视觉环境中遵循自然语言指令进行导航是一项具有挑战性的任务,因为自然语言指令具有高度可变性、模糊性和欠规范性。在本文中,我们提出了一种新颖的训练范式——向所有人学习(LEO),它利用同一轨迹的多个指令(作为不同视角)来解决语言歧义并改善泛化能力。通过跨指令共享参数,我们的方法从有限的训练数据中学习得更有效,并在未见过的环境中泛化得更好。在最近的 Room-to-Room(R2R)基准数据集上,LEO 相对于以贪婪智能体为基线的智能体在按路径长度加权的成功率(SPL)上取得了 16% 的绝对提升(25.3% 41.4%)。此外,LEO 对大多数现有的视觉与语言导航模型具有互补性,可轻松与现有技术集成,从而产生 LEO+,其创造了新的最优性能,将 R2R 基准推至 62%(9% 绝对提升)。
引用
@article{arxiv.2003.00857,
title = {Multi-View Learning for Vision-and-Language Navigation},
author = {Qiaolin Xia and Xiujun Li and Chunyuan Li and Yonatan Bisk and Zhifang Sui and Jianfeng Gao and Yejin Choi and Noah A. Smith},
journal= {arXiv preprint arXiv:2003.00857},
year = {2020}
}
备注
16 pages, 8 figures