MM-Diffusion:学习用于联合音视频生成的多模态扩散模型
计算机视觉与模式识别
2023-03-27 v2
摘要
我们提出了首个联合音视频生成框架,旨在同时带来引人入胜的视听体验,以生成高质量的逼真视频。为生成联合的音视频对,我们提出了一种新颖的多模态扩散模型(即 MM-Diffusion),该模型包含两个耦合的去噪自编码器。与现有的单模态扩散模型不同,MM-Diffusion 在设计上由一个序列化的多模态 U-Net 构成,用于联合去噪过程。其音频和视频两个子网络学习从高斯噪声中逐步生成对齐的音视频对。为确保跨模态的语义一致性,我们提出了一种新颖的基于随机移位的注意力模块,该模块桥接了两个子网络,实现了高效的跨模态对齐,从而增强了音视频彼此的保真度。大量实验表明,该模型在无条件音视频生成和零样本条件任务(例如,视频转音频)中均取得了优越的结果。特别是,我们在 Landscape 和 AIST++ 舞蹈数据集上取得了最佳的 FVD 和 FAD。包含 1 万次投票的图灵测试进一步证明了我们的模型具有显著优势。代码和预训练模型可在 https://github.com/researchmm/MM-Diffusion 下载。
引用
@article{arxiv.2212.09478,
title = {MM-Diffusion: Learning Multi-Modal Diffusion Models for Joint Audio and Video Generation},
author = {Ludan Ruan and Yiyang Ma and Huan Yang and Huiguo He and Bei Liu and Jianlong Fu and Nicholas Jing Yuan and Qin Jin and Baining Guo},
journal= {arXiv preprint arXiv:2212.09478},
year = {2023}
}
备注
Accepted by CVPR 2023