Talk2Nav:具有双重注意力与空间记忆的长程视觉-语言导航
计算机视觉与模式识别
2020-10-23 v3 计算与语言
机器人学
摘要
机器人在社会中的角色不断扩展,随之带来与人类交互和沟通的必要性。为保持此类交互的直观性,我们提供基于口头导航指令的自动寻路。我们的首个贡献是创建带有口头导航指令的大规模数据集。为此,我们基于Google Street View开发了交互式视觉导航环境;进一步设计了一种标注方法,以突出挖掘出的锚定地标及其间的局部方向,从而帮助标注者表述典型的人类参照。该标注任务在AMT平台上众包,构建了包含条路线的新Talk2Nav数据集。我们的第二个贡献是一种新的学习方法。受关于导航指令心理概念化的空间认知研究启发,我们引入定义在分段语言指令上的软双重注意力机制,以联合提取两条部分指令——一条用于匹配下一个即将出现的视觉地标,另一条用于匹配至下一地标的局部方向。类似地,我们还引入空间记忆方案来编码局部方向转移。我们的工作利用了两方面的研究进展:口头导航指令的心理形式化与训练神经网络智能体进行自动寻路。大量实验表明,我们的方法显著优于以往导航方法。有关演示视频、数据集与代码,请参阅我们的项目页面:https://www.trace.ethz.ch/publications/2019/talk2nav/index.html
引用
@article{arxiv.1910.02029,
title = {Talk2Nav: Long-Range Vision-and-Language Navigation with Dual Attention and Spatial Memory},
author = {Arun Balajee Vasudevan and Dengxin Dai and Luc Van Gool},
journal= {arXiv preprint arXiv:1910.02029},
year = {2020}
}
备注
Accepted to IJCV 2020, 20 pages, 10 Figures, Demo Video: https://people.ee.ethz.ch/~arunv/resources/talk2nav.mp4