LOViS:学习朝向与视觉信号用于视觉语言导航
计算机视觉与模式识别
2022-09-27 v1 人工智能
摘要
理解空间与视觉信息对遵循自然语言指令的导航智能体至关重要。当前基于 Transformer 的 VLN 智能体将朝向与视觉信息纠缠在一起,限制了从各信息源学习中获得的收益。本文中,我们设计了一个具有显式朝向模块与视觉模块的神经智能体。这些模块更有效地学习将指令中的空间信息与地标提及 grounding 到视觉环境中。为增强智能体的空间推理与视觉感知,我们设计了特定的预训练任务,以向最终导航模型中的相应模块供给并更好利用它们。我们在 Room2room (R2R) 与 Room4room (R4R) 数据集上评估我们的方法,并在两个基准上均取得最先进(state of the art)结果。
引用
@article{arxiv.2209.12723,
title = {LOViS: Learning Orientation and Visual Signals for Vision and Language Navigation},
author = {Yue Zhang and Parisa Kordjamshidi},
journal= {arXiv preprint arXiv:2209.12723},
year = {2022}
}