MESH2IR:面向复杂三维场景的神经声学脉冲响应生成器
声音
2022-07-13 v2 计算机视觉与模式识别
图形学
机器学习
多媒体
音频与语音处理
摘要
我们提出了一种基于网格的神经网络(MESH2IR),用于为以网格表示的室内三维场景生成声学脉冲响应(IRs)。这些 IR 用于交互式应用和音频处理中创建高质量声音体验。我们的方法可以处理具有任意拓扑(2K - 3M 个三角形)的输入三角网格。我们提出了一种新颖的训练技术,使用能量衰减 Relief 训练 MESH2IR,并强调了其益处。我们还表明,在我们提出的预处理技术下对 IR 训练 MESH2IR 显著提高了 IR 生成的准确性。我们通过使用图卷积网络将三维场景网格变换到潜空间,降低了网格空间中的非线性。我们的 MESH2IR 比 CPU 上的几何声学算法快 200 倍以上,并且能在 NVIDIA GeForce RTX 2080 Ti GPU 上针对给定带家具的室内三维场景每秒生成超过 10,000 个 IR。声学度量用于刻画声学环境。我们表明,从我们的 MESH2IR 预测的 IR 的声学度量与真实值的误差小于 10%。我们还强调了 MESH2IR 在音频和语音处理应用(如语音去混响和语音分离)上的益处。据我们所知,我们的方法是首个基于神经网络从给定三维场景网格实时预测 IR 的方法。
引用
@article{arxiv.2205.09248,
title = {MESH2IR: Neural Acoustic Impulse Response Generator for Complex 3D Scenes},
author = {Anton Ratnarajah and Zhenyu Tang and Rohith Chandrashekar Aralikatti and Dinesh Manocha},
journal= {arXiv preprint arXiv:2205.09248},
year = {2022}
}
备注
Accepted to ACM Multimedia 2022. More results and source code is available at https://anton-jeran.github.io/M2IR/