AV-GS:学习材质与几何感知先验用于新视角声学合成
声音
2025-03-18 v3 人工智能
音频与语音处理
摘要
新视角声学合成(NVAS)旨在给定3D场景中声源发出的单声道音频,在任意目标视角渲染双耳音频。现有方法提出了基于NeRF的隐式模型,利用视觉线索作为合成双耳音频的条件。然而,除了源于繁重NeRF渲染的低效率外,这些方法在刻画整个场景环境(如房间几何、材质属性以及听者与声源之间的空间关系)方面能力有限。为解决这些问题,我们提出了一种新颖的音频-视觉高斯泼溅(AV-GS)模型。为了获得用于音频合成的材质感知和几何感知条件,我们在局部初始化的高斯点上学习一个带有音频引导参数的显式基于点的场景表示,并考虑了听者和声源的空间关系。为了使视觉场景模型具有音频自适应性,我们提出了一种点密集化和剪枝策略,以最优方式分布高斯点,并考虑每个点在声音传播中的贡献(例如,无纹理的墙面需要更多点,因为它们会影响声音路径的偏转)。大量实验验证了我们的AV-GS在真实世界RWAS和基于仿真的SoundSpaces数据集上优于现有替代方法。
引用
@article{arxiv.2406.08920,
title = {AV-GS: Learning Material and Geometry Aware Priors for Novel View Acoustic Synthesis},
author = {Swapnil Bhosale and Haosen Yang and Diptesh Kanojia and Jiankang Deng and Xiatian Zhu},
journal= {arXiv preprint arXiv:2406.08920},
year = {2025}
}
备注
Accepted to NeurIPS 2024