中文

CMMD:用于视频-音频条件建模的对比多模态扩散

机器学习 2024-10-10 v2 计算机视觉与模式识别 多媒体 声音 音频与语音处理

摘要

我们介绍了一种专为视频和音频的双向条件生成量身定制的多模态扩散模型。我们提出了一种联合对比训练损失,以改善视觉与听觉事件之间的同步性。我们在两个数据集上进行了实验,以评估我们提出模型的有效性。从多个角度对生成质量和对齐性能进行了评估,包括客观和主观指标。我们的研究结果表明,通过引入我们新颖的跨模态简单融合架构块,所提出的模型在质量和生成速度方面优于基线模型。此外,对比损失的引入改善了视听对齐,特别是在高相关性的视频到音频生成任务中。

关键词

引用

@article{arxiv.2312.05412,
  title  = {CMMD: Contrastive Multi-Modal Diffusion for Video-Audio Conditional Modeling},
  author = {Ruihan Yang and Hannes Gamper and Sebastian Braun},
  journal= {arXiv preprint arXiv:2312.05412},
  year   = {2024}
}