显式上下文驱动的神经声学建模用于高保真RIR生成
声音
2025-09-19 v1 人工智能
机器学习
摘要
逼真的声音模拟在许多应用中扮演着关键角色。声音模拟的一个关键要素是房间脉冲响应(RIR),它表征了声音在给定空间内从声源到听者传播的方式。近期研究已应用神经隐式方法,利用来自环境的上下文信息(如场景图像)来学习RIR。然而,这些方法未能有效利用来自环境的显式几何信息。为了进一步挖掘神经隐式模型结合直接几何特征的潜力,我们提出了Mesh-infused Neural Acoustic Field(MiNAF),它在给定位置查询粗略的房间网格,并提取距离分布作为局部上下文的显式表示。我们的方法表明,纳入显式的局部几何特征可以更好地引导神经网络生成更精确的RIR预测。通过与常规和最先进基线方法的比较,我们表明MiNAF在各种评估指标上具有竞争力。此外,我们验证了MiNAF在训练样本有限的数据集中的鲁棒性,证明了在高保真声音模拟方面的进展。
引用
@article{arxiv.2509.15210,
title = {Explicit Context-Driven Neural Acoustic Modeling for High-Fidelity RIR Generation},
author = {Chen Si and Qianyi Wu and Chaitanya Amballa and Romit Roy Choudhury},
journal= {arXiv preprint arXiv:2509.15210},
year = {2025}
}