中文

Apollo:统一的多任务音视频联合生成

计算机视觉与模式识别 2026-01-14 v2 人工智能 多媒体 声音

摘要

音视频联合生成取得了快速进展,但仍面临诸多挑战。非商业方法仍受音视频不同步、唇语与语音错位以及单模态退化的限制,这些问题可归因于弱的音视频对应性建模、泛化能力有限以及稀缺的高质量密集描述数据。为此,我们提出 Apollo,从模型架构、训练策略和数据 curated 三个维度进行改进。架构上,我们采用单塔设计,统一 DiT 块,引入 Omni-Full Attention 机制,实现紧密的音视频对齐和强大的可扩展性。训练上,我们采用随机模态遮蔽到联合优化跨任务的渐进多任务方案,以及多阶段课程训练,获得稳健的表示,强化音视频对齐的世界知识,防止单模态崩溃。数据方面,我们首个构建大规模音视频数据集,配有密集描述,并引入新颖的自动化数据构建管道,对数百万个多样化、高质量、严格对齐的音视频-文本三元组进行标注与过滤。基于此,Apollo 可扩展至大规模数据集,实现在联合和单模态设置下,都能提供高保真、语义和时间对齐、遵循指令的生成,同时对 out-of-distribution 场景具有稳健的泛化能力。在各类任务中,Apollo 显著超越先前方法,性能媲美 Veo 3,为下一代音视频合成提供了统一、可扩展的路径。

关键词

引用

@article{arxiv.2601.04151,
  title  = {Apollo: Unified Multi-Task Audio-Video Joint Generation},
  author = {Jun Wang and Chunyu Qiang and Yuxin Guo and Yiran Wang and Xijuan Zeng and Feng Deng},
  journal= {arXiv preprint arXiv:2601.04151},
  year   = {2026}
}