基于三维重建房间的未知视角声学合成
声音
2024-08-19 v2 计算机视觉与模式识别
音频与语音处理
摘要
我们研究了将盲音频录音与三维场景信息相结合用于未知视角声学合成的优势。给定来自 2-4 个麦克风的音频录音以及包含多个未知声源的场景的三维几何与材质,我们估计场景中任意位置的声学信号。我们将未知视角声学合成的主要挑战确定为声源定位、分离与去混响。虽然朴素地训练端到端网络无法产生高质量结果,但我们表明,引入从三维重建房间导出的房间脉冲响应(RIRs)能使同一网络联合应对这些任务。我们的方法优于为单个任务设计的现有方法,证明了其利用三维视觉信息的有效性。在 Matterport3D-NVAS 数据集上的模拟研究中,我们的模型在声源定位上达到近乎完美的精度,在声源分离与去混响上达到 26.44dB 的 PSNR 和 14.23dB 的 SDR,从而在未知视角声学合成上获得 25.55 dB 的 PSNR 和 14.20 dB 的 SDR。我们在项目网站 https://github.com/apple/ml-nvas3d 上发布了代码与模型。聆听结果时请佩戴耳机。
引用
@article{arxiv.2310.15130,
title = {Novel-View Acoustic Synthesis from 3D Reconstructed Rooms},
author = {Byeongjoo Ahn and Karren Yang and Brian Hamilton and Jonathan Sheaffer and Anurag Ranjan and Miguel Sarabia and Oncel Tuzel and Jen-Hao Rick Chang},
journal= {arXiv preprint arXiv:2310.15130},
year = {2024}
}
备注
Interspeech 2024