中文

SoundSpaces 2.0:面向视觉-听觉学习的仿真平台

声音 2023-01-24 v2 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

我们介绍 SoundSpaces 2.0,一个用于三维环境中基于几何的实时音频渲染平台。给定真实世界环境的 3D 网格,SoundSpaces 能够为从任意麦克风位置捕获的任意声音生成高度逼真的声学效果。结合现有的 3D 视觉资产,它支持一系列音视觉研究任务,如音视觉导航、建图、声源定位与分离,以及声学匹配。与现有资源相比,SoundSpaces 2.0 具有允许连续空间采样、对未知环境的泛化能力,以及可配置的麦克风和材料属性等优势。据我们所知,这是首个基于几何的声学仿真,在提供高保真与真实感的同时,速度也足以用于具身学习。我们展示了该仿真器的特性,并将其性能与真实世界的音频测量进行了基准比较。此外,我们演示了两个下游任务——具身导航与远场自动语音识别——并重点展示了后者在 sim2real(仿真到真实)上的性能。SoundSpaces 2.0 已公开可用,以促进对既能看又能听的感知系统的更广泛研究。

关键词

引用

@article{arxiv.2206.08312,
  title  = {SoundSpaces 2.0: A Simulation Platform for Visual-Acoustic Learning},
  author = {Changan Chen and Carl Schissler and Sanchit Garg and Philip Kobernik and Alexander Clegg and Paul Calamia and Dhruv Batra and Philip W Robinson and Kristen Grauman},
  journal= {arXiv preprint arXiv:2206.08312},
  year   = {2023}
}

备注

Camera-ready version. Website: https://soundspaces.org. Project page: https://vision.cs.utexas.edu/projects/soundspaces2