NAT:面向实时互动场景的神经声学传递
声音
2025-08-13 v1 图形学
音频与语音处理
摘要
以往的声学传递方法依赖大量预计算和数据存储以实现实时交互与听觉反馈,但这些方法在复杂场景下难以处理,尤其当物体位置、材料和尺寸动态变化时会显著改变声效。这些连续变化导致声学传递分布波动,难以用基本数据结构表示且在实时渲染中效率低下。为此,本文提出神经声学传递(Neural Acoustic Transfer, NAT),一种新颖方法利用隐式神经表示编码预计算的声学传递及其变化,实现在不同条件下实时预测声场。为高效生成神经声学场所需的训练数据,我们开发了一种针对含光滑 Neumann 边界条件的通用情形的快速蒙特卡洛基于边界元方法(BEM)近似。此外,我们实现了标准 BEM 的 GPU 加速版本,以满足对更高精度需求的情形。这些方法为神经网络提供必要的训练数据,使其能够准确建模声辐射空间。我们通过在多样化声学传递场景中的全面验证与比较,展示了该方法的数值精度与运行时效率(30 秒音频仅需数毫秒)。该方法允许在动态变化的环境中高效且准确地建模声行为,适用于虚拟现实、增强现实及高级音频制作等广泛互动应用。
引用
@article{arxiv.2506.06190,
title = {NAT: Neural Acoustic Transfer for Interactive Scenes in Real Time},
author = {Xutong Jin and Bo Pang and Chenxi Xu and Xinyun Hou and Guoping Wang and Sheng Li},
journal= {arXiv preprint arXiv:2506.06190},
year = {2025}
}