MMAudio:用于高质量视频转音频合成的多模态联合训练
计算机视觉与模式识别
2025-04-09 v2 机器学习
声音
音频与语音处理
摘要
我们提出一种新颖的多模态联合训练框架MMAudio,用于给定视频和可选文本条件时合成高质量且同步的音频。与仅基于(有限)视频数据进行单模态训练不同,MMAudio使用更大规模、 readily available 的文本-音频数据进行联合训练,以学习生成语义对齐的高质量音频样本。此外,我们通过条件同步模块改进了音视频同步性,该模块在帧级别将视频条件与音频潜表示对齐。基于流匹配目标训练的MMAudio在音频质量、语义对齐和音视频同步方面实现了公开模型的最新视频转音频SOTA,同时具有低推理时间(仅需1.23秒生成8秒片段)和1.57亿参数。MMAudio在文本转音频生成中也表现出惊人的竞争力,表明联合训练并未损害单模态性能。代码和演示可在:https://hkchengrex.github.io/MMAudio 查阅。
引用
@article{arxiv.2412.15322,
title = {MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis},
author = {Ho Kei Cheng and Masato Ishii and Akio Hayakawa and Takashi Shibuya and Alexander Schwing and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2412.15322},
year = {2025}
}
备注
Accepted to CVPR 2025. Project page: https://hkchengrex.github.io/MMAudio