AV-NeRF:面向真实世界音视频场景合成的神经场学习
计算机视觉与模式识别
2023-10-17 v3 图形学
声音
音频与语音处理
摘要
记录音视频场景的机器能否在新的位置和新的视线方向生成逼真、匹配的音视频体验?我们通过研究一项新任务——真实世界音视频场景合成——以及一种首创的基于 NeRF 的多模态学习方法对此做出回答。具体而言,给定一段音视频场景的视频记录,任务是在该场景中沿任意新的相机轨迹合成带有空间音频的新视频。我们提出一个声学感知的音频生成模块,将音频传播的先验知识融入 NeRF,其中我们隐式地将音频生成与视觉环境的 3D 几何和材质属性关联起来。此外,我们提出一个坐标变换模块,用于表达相对于声源的视线方向,使模型能够学习以声源为中心的声场。为促进这项新任务的研究,我们收集了一个高质量的 Real-World Audio-Visual Scene (RWAVS) 数据集。我们在此真实世界数据集和基于仿真的 SoundSpaces 数据集上展示了方法的优势。
引用
@article{arxiv.2302.02088,
title = {AV-NeRF: Learning Neural Fields for Real-World Audio-Visual Scene Synthesis},
author = {Susan Liang and Chao Huang and Yapeng Tian and Anurag Kumar and Chenliang Xu},
journal= {arXiv preprint arXiv:2302.02088},
year = {2023}
}
备注
NeurIPS 2023