Listen2Scene:面向重建 3D 场景的交互式材质感知双耳声传播
音频与语音处理
2024-02-09 v4 计算机视觉与模式识别
机器学习
多媒体
声音
摘要
我们提出了一种用于虚拟现实(VR)和增强现实(AR)应用的端到端双耳音频渲染方法(Listen2Scene)。我们提出了一种新颖的基于神经网络的双耳声传播方法,以生成真实环境室内 3D 模型的声学效果。任何纯净音频或干音频都可以与生成的声学效果进行卷积,以渲染对应于真实环境的音频。我们提出了一种图神经网络,它同时使用 3D 场景的材质和拓扑信息,并生成场景潜在向量。此外,我们使用条件生成对抗网络(CGAN)从场景潜在向量生成声学效果。我们的网络能够处理重建 3D 网格模型中的孔洞或其他伪影。我们为生成器网络提出了一种有效的代价函数,以结合空间音频效果。给定声源和听者位置,我们基于学习的双耳声传播方法可以在 NVIDIA GeForce RTX 2080 Ti GPU 上于 0.1 毫秒内生成声学效果。我们使用交互式几何声传播算法生成的双耳声学效果以及捕获的真实声学效果/真实世界录音,评估了该方法的准确性。我们还进行了感知评估,观察到由该方法渲染的音频比使用先前基于学习和基于几何的声传播算法渲染的音频更具真实感。我们使用统计声学参数和能量衰减曲线定量评估了该方法的准确性。演示视频、代码和数据集可在线获取(https://anton-jeran.github.io/Listen2Scene/)。
引用
@article{arxiv.2302.02809,
title = {Listen2Scene: Interactive material-aware binaural sound propagation for reconstructed 3D scenes},
author = {Anton Ratnarajah and Dinesh Manocha},
journal= {arXiv preprint arXiv:2302.02809},
year = {2024}
}
备注
Accepted to IEEE VR 2024. Project page: https://anton-jeran.github.io/Listen2Scene/