中文

联合音频-视频生成的扩散模型

声音 2026-03-18 v1 人工智能 计算机视觉与模式识别 多媒体

摘要

多模态生成模型在单模态视频和音频合成方面取得了显著进展,但真正的联合音频-视频生成仍是一个开放挑战。本文中,我对推进该领域的四个关键贡献进行了探索。首先,我发布了两个高质量的、成对的音频-视频数据集。数据集包括 13 小时的游戏片段和 64 小时的演出录像,每个片段被分割为一致的 34 秒样本,以促进可重复的研究。其次,我从头为数据集训练 MM-Diffusion 架构,展示了其产生语义连贯音频-视频对的能力,并对快速动作和音乐线索的对齐进行了量化评估。第三,我通过利用预训练的视频和音频编码器-解码器,探索了联合潜在扩散,揭示了多模态解码阶段的挑战和不一致性。最后,我提出了一个顺序的两步文本到音频-视频生成管道:首先生成视频,然后在视频输出和原始提示都作为条件来合成同步的音频。我的实验表明,这种模块化方法可产生高保真度的音频视频生成。

关键词

引用

@article{arxiv.2603.16093,
  title  = {Diffusion Models for Joint Audio-Video Generation},
  author = {Alejandro Paredes La Torre},
  journal= {arXiv preprint arXiv:2603.16093},
  year   = {2026}
}