MMControl:面向联合音视频生成的统一多模态控制
计算机视觉与模式识别
2026-04-23 v2
摘要
扩散Transformer(DiTs)的最新进展使得高质量联合音视频生成成为可能,能够在单一模型内生成带有同步音频的视频。然而,现有的可控生成框架通常局限于仅对视频进行控制。这限制了全面的可控性,且常导致跨模态对齐效果欠佳。为弥补这一不足,我们提出MMControl,使用户能够在联合音视频生成中执行多模态控制。MMControl引入双流条件注入机制,将视觉与声学控制信号(包括参考图像、参考音频、深度图和姿态序列)整合至联合生成过程中。这些条件通过旁路分支注入联合音视频扩散Transformer,使模型能够在结构约束下同时生成身份一致的视频与音色一致的音频。此外,我们引入特定模态的引导缩放,允许用户在推理时独立且动态地调整各视觉与声学条件的影响强度。大量实验表明,MMControl在联合音视频生成中实现了对人物身份、声音音色、身体姿态和场景布局的细粒度、可组合控制。
引用
@article{arxiv.2604.19679,
title = {MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation},
author = {Liyang Li and Wen Wang and Canyu Zhao and Tianjian Feng and Zhiyue Zhao and Hao Chen and Chunhua Shen},
journal= {arXiv preprint arXiv:2604.19679},
year = {2026}
}
备注
Project page: https://aim-uofa.github.io/MMControl/