具有多流时间控制的音频同步视频生成
计算机视觉与模式识别
2025-06-10 v1 人工智能
摘要
音频本质上是时间性的,并且与视觉世界紧密同步,这使其成为可控视频生成(例如电影)中一种天然对齐且富有表现力的控制信号。除了控制之外,将音频直接转化为视频对于理解和可视化丰富的音频叙事(例如播客或历史录音)也至关重要。然而,现有方法在生成具有精确音视频同步的高质量视频方面存在不足,尤其是在处理多样且复杂的音频类型时。在这项工作中,我们引入了 MTV,一个用于音频同步视频生成的多功能框架。MTV 将音频显式分离为语音、音效和音乐轨道,从而分别实现对唇部运动、事件时机和视觉氛围的解耦控制——进而实现细粒度且语义对齐的视频生成。为了支持该框架,我们额外提出了 DEMIX,一个包含高质量电影视频和分离音轨的数据集。DEMIX 被划分为五个重叠子集,支持针对多样生成场景的可扩展多阶段训练。大量实验表明,MTV 在涵盖视频质量、文本-视频一致性和音视频对齐的六项标准指标上均达到了 SOTA 性能。项目页面:https://hjzheng.net/projects/MTV/。
引用
@article{arxiv.2506.08003,
title = {Audio-Sync Video Generation with Multi-Stream Temporal Control},
author = {Shuchen Weng and Haojie Zheng and Zheng Chang and Si Li and Boxin Shi and Xinlong Wang},
journal= {arXiv preprint arXiv:2506.08003},
year = {2025}
}