中文

无处不在地听见任何声音

声音 2024-06-12 v1 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

近年来,3D计算机视觉和计算机图形学取得了显著进展,涌现出能够为众多混合现实(XR)应用虚拟化真实世界3D环境的工具。然而,除了沉浸式视觉体验之外,沉浸式听觉体验同样重要,我们才能全面感知环境。在本文中,我们旨在仅凭一组稀疏的(约12个)房间冲击响应(RIR)录音以及场景的平面重建,重建任意环境的空间声学特征,这种 setup 容易被普通用户实现。为此,我们引入 DiffRIR,一种可微分RIR渲染框架,采用可解释的参数化模型描述场景中显著声学特征,包括声源方向性和表面反射性。这允许我们通过任意声源音频合成空间内的新型听觉体验。为评估本方法,我们收集了来自四个多样化真实环境中的 RIR 录音和音乐数据。我们展示了在未见位置处渲染单声道和立体声 RIR 以及音乐时,本模型在渲染效果上超过了最先进的基准,并学习了描述声源和场景表面声学特性的物理可解释参数。

关键词

引用

@article{arxiv.2406.07532,
  title  = {Hearing Anything Anywhere},
  author = {Mason Wang and Ryosuke Sawata and Samuel Clarke and Ruohan Gao and Shangzhe Wu and Jiajun Wu},
  journal= {arXiv preprint arXiv:2406.07532},
  year   = {2024}
}

备注

CVPR 2024. The first two authors contributed equally. Project page: https://masonlwang.com/hearinganythinganywhere/