中文

通过探索跨模态记忆的视觉对话导航

计算机视觉与模式识别 2020-03-17 v1 计算与语言

摘要

视觉对话导航作为视觉语言学科中一个新的圣杯任务,旨在学习一个具备持续对话以获取自然语言帮助并根据人类回应进行导航能力的智能体。除了视觉语言导航中面临的常见挑战外,视觉对话导航还需要妥善处理来自对话历史的时间上下文的一系列问题的语言意图,并对对话和视觉场景进行协同推理。在本文中,我们提出跨模态记忆网络(CMN)来记忆和理解与历史导航动作相关的丰富信息。我们的 CMN 由两个记忆模块组成,语言记忆模块(L-mem)和视觉记忆模块(V-mem)。具体而言,L-mem 通过采用多头注意力机制学习当前语言交互与对话历史之间的潜在关系。V-mem 学习将当前视觉视图与关于先前导航动作的跨模态记忆相关联。跨模态记忆通过视觉到语言注意力和语言到视觉注意力生成。受益于 L-mem 和 V-mem 的协同学习,我们的 CMN 能够探索关于用于当前步骤的历史导航动作决策的记忆。在 CVDN 数据集上的实验表明,我们的 CMN 在已见和未见环境上都以显著优势优于先前的最先进模型。

关键词

引用

@article{arxiv.2003.06745,
  title  = {Vision-Dialog Navigation by Exploring Cross-modal Memory},
  author = {Yi Zhu and Fengda Zhu and Zhaohuan Zhan and Bingqian Lin and Jianbin Jiao and Xiaojun Chang and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2003.06745},
  year   = {2020}
}

备注

CVPR2020