基于多视觉先验的可微分房间声学渲染
计算机视觉与模式识别
2025-08-19 v2 声音
摘要
空间音频所营造的沉浸式声学体验,与视觉方面同样至关重要,以构建真实逼真的虚拟环境。然而,现有方法要么依赖数据驱动的学习模型(需要大量数据),要么依赖计算昂贵的物理建模。本文引入Audio-Visual Differentiable Room Acoustic Rendering(AV-DAR)框架,利用从多视角图像中提取的视觉线索和声学光线追踪,进行基于物理的房间声学渲染。实验覆盖来自两个数据集的六个真实环境,表明该多模态、基于物理的方法高效、可解释且精确,显著优于一系列先前方法。在Real Acoustic Field数据集上,AV-DAR在相同数据规模下训练时,实现了16.6%至50.9%的相对提升;而在数据规模为10倍的情况下,其性能却与训练了10倍数据的模型持平。
引用
@article{arxiv.2504.21847,
title = {Differentiable Room Acoustic Rendering with Multi-View Vision Priors},
author = {Derong Jin and Ruohan Gao},
journal= {arXiv preprint arXiv:2504.21847},
year = {2025}
}
备注
ICCV 2025 (Oral); Project Page: https://humathe.github.io/avdar/