中文

MMDisCo:基于多模态判别器引导的协作扩散用于联合音视频生成

计算机视觉与模式识别 2025-02-26 v2 机器学习 多媒体 声音 音频与语音处理

摘要

本研究旨在通过利用预训练的单模态音频和视频生成模型,构建一种计算成本最低的音视频生成模型。为实现此目标,我们提出了一种新方法,通过引导单模态模型协同生成跨模态的对齐样本。具体而言,给定两个预训练的基础扩散模型,我们训练一个轻量级的联合引导模块,以调整由基础模型单独估计的得分,以匹配音视频联合分布的得分。我们表明,这种引导可使用最优判别器的梯度来计算,该判别器独立地区分真实音视频对与由基础模型生成的假音视频对。基于此分析,我们通过训练判别器构建联合引导模块。此外,我们采用一种损失函数来稳定判别器的梯度,使其作为噪声估计器,类似于标准扩散模型。在多个基准数据集上的实证评估表明,我们的方法在保持相对少数参数的同时,提高了单模态保真度和多模态对齐度。代码已公开:https://github.com/SonyResearch/MMDisCo。

关键词

引用

@article{arxiv.2405.17842,
  title  = {MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation},
  author = {Akio Hayakawa and Masato Ishii and Takashi Shibuya and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2405.17842},
  year   = {2025}
}

备注

ICLR 2025