中文

SoundVista:基于视觉-声学绑定的新视角环境声合成

声音 2025-04-09 v1 人工智能 计算机视觉与模式识别 多媒体

摘要

我们介绍SoundVista,一种生成任意场景在新视角下环境声的方法。给定来自稀疏分布麦克风的预采集录音,SoundVista可从未见的目标视角合成该场景的声音。该方法学习关联分布式麦克风获取的信号与目标视角信号的底层声学传递函数,仅需少量已知录音。与现有工作不同,本方法无需声源细节的约束或先验知识。此外,本方法能有效适应多样化的房间布局、参考麦克风配置和未见环境。为实现此目标,我们引入了视觉-声学绑定模块,从全景RGB和深度数据中学习与局部声学属性关联的视觉嵌入。我们首先利用这些嵌入优化给定场景中参考麦克风的放置。合成时,我们从参考位置提取多个嵌入,以条件化目标视角获取其贡献的自适应权重。我们在公开数据集和真实场景上对该任务进行基准测试。我们在现有方法上实现了显著的改进。

关键词

引用

@article{arxiv.2504.05576,
  title  = {SoundVista: Novel-View Ambient Sound Synthesis via Visual-Acoustic Binding},
  author = {Mingfei Chen and Israel D. Gebru and Ishwarya Ananthabhotla and Christian Richardt and Dejan Markovic and Jake Sandakly and Steven Krenn and Todd Keebler and Eli Shlizerman and Alexander Richard},
  journal= {arXiv preprint arXiv:2504.05576},
  year   = {2025}
}

备注

Highlight Accepted to CVPR 2025