NeRAF:3 维场景嵌入的神经辐射与声学场
声音
2025-10-03 v4 计算机视觉与模式识别
音频与语音处理
摘要
声音在人类感知中占据重要位置。除了视觉外,它为理解周围环境提供essential信息。尽管神经隐式表示取得了进展,但学习与视觉场景相匹配的声学模型仍是一个挑战。我们提出了 NeRAF 方法,联合学习声学与辐射场。NeRAF 在 radiance field 条件下,能够在新位置合成新视角和空间化房间脉冲响应 (RIR)。生成的 RIR 可用于对任意音频信号进行声学化处理。每种模态都可在空间上不同位置独立渲染,提供更大的灵活性。我们在 SoundSpaces 和 RAF 数据集上演示,NeRAF 能生成高质量音频,相较于先前方法实现了显著性能提升,同时更数据高效。此外,NeRAF 通过跨模态学习,提高了在稀疏数据下训练复杂场景的新视角合成质量。NeRAF 设计为 Nerfstudio 模块,提供逼真的音频-视觉生成便利。
引用
@article{arxiv.2405.18213,
title = {NeRAF: 3D Scene Infused Neural Radiance and Acoustic Fields},
author = {Amandine Brunetto and Sascha Hornauer and Fabien Moutarde},
journal= {arXiv preprint arXiv:2405.18213},
year = {2025}
}
备注
ICLR 2025 (Poster). Camera ready version. Project Page: https://amandinebtto.github.io/NeRAF; 24 pages, 13 figures