新视角声学合成
计算机视觉与模式识别
2023-10-26 v3 声音
音频与语音处理
摘要
我们提出了新视角声学合成(NVAS)任务:给定在源视角观察到的画面与声音,我们能否从未见过的目标视角合成该场景的声音?我们提出了一种神经渲染方法:视觉引导声学合成(ViGAS)网络,该网络通过学习分析输入的视听线索,来合成空间中任意点的声音。为了对该任务进行基准测试,我们收集了两个首创的大规模多视角视听数据集,一个为合成数据,一个为真实数据。我们表明,我们的模型能够成功推理空间线索,并在两个数据集上合成出逼真的音频。据我们所知,本工作是首个针对新视角声学合成任务的公式化定义、数据集与解决方法,其在从 AR/VR 到艺术与设计等领域具有令人振奋的潜在应用。通过本工作得以解锁,我们认为新视角合成的未来在于从视频中进行多模态学习。
引用
@article{arxiv.2301.08730,
title = {Novel-View Acoustic Synthesis},
author = {Changan Chen and Alexander Richard and Roman Shapovalov and Vamsi Krishna Ithapu and Natalia Neverova and Kristen Grauman and Andrea Vedaldi},
journal= {arXiv preprint arXiv:2301.08730},
year = {2023}
}
备注
Accepted at CVPR 2023. Project page: https://vision.cs.utexas.edu/projects/nvas