看、听与行动:迈向音视觉具身导航
计算机视觉与模式识别
2020-03-10 v2 机器学习
机器人学
声音
音频与语音处理
摘要
移动智能体的一个关键能力是整合环境中多感官输入的证据,并做出一系列动作以达成目标。本文中,我们试图探讨音视觉具身导航问题,即在室内环境中仅给定原始第一视角视觉与音频感官数据,从场景中随机起始位置规划至声源的最短路径之任务。为完成该任务,智能体需从多种模态中学习,即把音频信号与视觉环境相关联。我们在此描述一种利用视觉与音频两方面证据的音视觉具身导航方法。我们的方案基于三个关键思想:构建环境空间记忆的视觉感知映射模块、推断声源相对智能体位置的听觉感知模块,以及基于音视觉观测与环境空间记忆规划动作序列以导航至目标的动态路径规划器。在新建的Visual-Audio-Room数据集上、使用模拟多模态环境的实验结果证明了我们的方法优于若干有竞争力的基线。
引用
@article{arxiv.1912.11684,
title = {Look, Listen, and Act: Towards Audio-Visual Embodied Navigation},
author = {Chuang Gan and Yiwei Zhang and Jiajun Wu and Boqing Gong and Joshua B. Tenenbaum},
journal= {arXiv preprint arXiv:1912.11684},
year = {2020}
}
备注
Accepted by ICRA 2020. Project page: http://avn.csail.mit.edu