声音视频生成的简单但强大的基线:有效适配音频和视频扩散模型的联合生成
机器学习
2025-04-10 v3 多媒体
声音
音频与语音处理
摘要
本文构建了声音视频生成的简单但强大的基线。给定音频和视频基础扩散模型,我们将其与额外模块集成到单个模型中进行训练,使其能够联合生成音频和视频。为增强音频-视频对之间的对齐效能,我们在模型中引入了两种新机制。第一种是时间步调整机制,为每个基础模型提供不同的时间步信息,旨在对齐跨模态样本在时间步上的生成方式。第二种是额外模块的新设计,称为跨模态条件编码作为位置编码(CMC-PE)。在CMC-PE中,跨模态信息被嵌入到类似表示时间位置信息的方式中,嵌入像位置编码一样输入到模型中。与流行的跨注意力机制相比,CMC-PE为生成数据的时序对齐提供了更好的归纳偏置。实验结果验证了两种新引入机制的有效性,并表明我们的方法在现有方法上取得优异性能。
引用
@article{arxiv.2409.17550,
title = {A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation},
author = {Masato Ishii and Akio Hayakawa and Takashi Shibuya and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2409.17550},
year = {2025}
}
备注
IJCNN 2025. The source code is available: https://github.com/SonyResearch/SVG_baseline