OmniAudio: 从 360 度视频生成全向音频
音频与语音处理
2025-06-04 v3 计算机视觉与模式识别
声音
摘要
传统的视频到音频生成技术主要关注平视视频和非全向音频,常常缺失准确表示 3D 环境中声源所必需的空间线索。为解决这一限制,我们提出一种新任务 360V2SA,即从 360 度视频生成全向音频,具体生成 First-order Ambisonics (FOA) 音频——这是一种用于表示 3D 全向音频的标准格式,能够捕捉声音方向性并实现真实的 3D 音频再现。我们首先创建了 Sphere360 数据集,专为该任务而设计,源自真实世界数据。我们还设计了一种高效的半自动化管道,用于收集和清理配对的视频-音频数据。为从 360 度视频生成全向音频,我们提出了一种新框架 OmniAudio,它利用自监督预训练,结合以 FOA 格式的空间音频数据和大规模非空间数据。此外,OmniAudio 具备双分支框架,利用全景和平视视频输入,全面捕获 360 度视频中的局部和全局信息。实验结果表明,OmniAudio 在 Sphere360 数据集上的客观和主观指标上均实现了最先进的性能。代码和数据集已提供:https://github.com/liuhuadai/OmniAudio。项目网站地址为 https://OmniAudio-360V2SA.github.io。
引用
@article{arxiv.2504.14906,
title = {OmniAudio: Generating Spatial Audio from 360-Degree Video},
author = {Huadai Liu and Tianyi Luo and Kaicheng Luo and Qikai Jiang and Peiwen Sun and Jialei Wang and Rongjie Huang and Qian Chen and Wen Wang and Xiangtai Li and Shiliang Zhang and Zhijie Yan and Zhou Zhao and Wei Xue},
journal= {arXiv preprint arXiv:2504.14906},
year = {2025}
}
备注
ICML 2025