面向视觉与语言导航的跨模态地图学习
计算机视觉与模式识别
2022-03-22 v3 机器人学
摘要
我们考虑视觉与语言导航(VLN)问题。当前大多数 VLN 方法采用端到端训练,或使用如 LSTM 之类的非结构化记忆,或在对智能体的自我中心观测上使用跨模态注意力。与其他工作不同,我们的核心见解是:当语言与视觉的关联发生在显式空间表征中时,二者联系更强。在本工作中,我们提出一种用于视觉与语言导航的跨模态地图学习模型,该模型首先学习在自我中心地图上预测已观测与未观测区域的俯视语义,然后将通向目标的路径预测为一组路点。在这两种情况下,预测均通过跨模态注意力机制受语言引导。我们通过实验检验了基本假设——给定地图可解决语言驱动导航问题,随后在完整的 VLN-CE 基准上展示了具有竞争力的结果。
引用
@article{arxiv.2203.05137,
title = {Cross-modal Map Learning for Vision and Language Navigation},
author = {Georgios Georgakis and Karl Schmeckpeper and Karan Wanchoo and Soham Dan and Eleni Miltsakaki and Dan Roth and Kostas Daniilidis},
journal= {arXiv preprint arXiv:2203.05137},
year = {2022}
}