中文

一种具有噪声水平混合的多功能扩散Transformer用于视听生成

计算机视觉与模式识别 2025-06-10 v1 机器学习 多媒体 声音 音频与语音处理

摘要

训练用于视听序列的扩散模型可以通过学习两种模态的各种输入输出组合的条件分布来实现一系列生成任务。然而,这种策略通常需要为每个任务训练一个单独的模型,成本高昂。在这里,我们提出了一种新颖的训练方法,以有效学习视听空间中的任意条件分布。我们的关键贡献在于我们如何参数化前向扩散过程中的扩散时间步。我们不是采用标准的固定扩散时间步,而是提出在时间维度和输入模态之间应用可变的扩散时间步。这种公式提供了灵活性,可以为输入的不同部分引入可变的噪声水平,因此称为噪声水平混合。我们提出了一种基于Transformer的视听潜在扩散模型,并表明可以使用我们的方法以任务无关的方式进行训练,从而在推理时实现各种视听生成任务。实验证明了我们的方法在处理视听空间中的跨模态和多模态插值任务方面的多功能性。值得注意的是,我们提出的方法在生成以输入为条件的时间上和感知上一致的样本方面超越了基线。项目页面:avdit2024.github.io

关键词

引用

@article{arxiv.2405.13762,
  title  = {A Versatile Diffusion Transformer with Mixture of Noise Levels for Audiovisual Generation},
  author = {Gwanghyun Kim and Alonso Martinez and Yu-Chuan Su and Brendan Jou and José Lezama and Agrim Gupta and Lijun Yu and Lu Jiang and Aren Jansen and Jacob Walker and Krishna Somandepalli},
  journal= {arXiv preprint arXiv:2405.13762},
  year   = {2025}
}