中文

SoundSpaces:三维环境中的视听导航

计算机视觉与模式识别 2020-08-25 v3 人机交互 声音 音频与语音处理

摘要

在世界中移动自然是一种多感官体验,但当今的具身智能体是“聋”的——仅限于对环境的纯视觉感知。我们为复杂、声学与视觉逼真的三维环境引入了视听导航。通过同时看见与听见,智能体必须学习导航至发声对象。我们提出一种多模态深度强化学习方法,从自我中心的视听观测流中端到端训练导航策略,使智能体能够(1)发现由混响音频所指示的物理空间几何元素,以及(2)检测并跟随发声目标。我们进一步引入 SoundSpaces:基于几何声学仿真为两套公开可用的三维环境(Matterport3D 与 Replica)渲染音频的首个此类数据集,并为 Habitat 配置新传感器支持,从而可在一系列真实世界扫描环境中插入任意声源。我们的结果表明,音频极大裨益于三维空间中的具身视觉导航,且我们的工作为具身 AI 中视听感知的新研究奠定基础。

关键词

引用

@article{arxiv.1912.11474,
  title  = {SoundSpaces: Audio-Visual Navigation in 3D Environments},
  author = {Changan Chen and Unnat Jain and Carl Schissler and Sebastia Vicenc Amengual Gari and Ziad Al-Halah and Vamsi Krishna Ithapu and Philip Robinson and Kristen Grauman},
  journal= {arXiv preprint arXiv:1912.11474},
  year   = {2020}
}

备注

Accepted to ECCV 2020 (Spotlight). Project page: http://vision.cs.utexas.edu/projects/audio_visual_navigation/