中文

Diff-Foley:基于潜在扩散模型的同步视频到音频合成

声音 2023-07-03 v1 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

视频到音频(V2A)模型近期因其在从无声视频直接生成音频(尤其在视频/电影制作中)的实际应用而受到关注。然而,先前的 V2A 方法在时序同步和视听相关性方面的生成质量有限。我们提出 Diff-Foley,一种采用潜在扩散模型(LDM)的同步视频到音频合成方法,可生成具有改进同步与视听相关性的高质量音频。我们采用对比视听预训练(CAVP)学习更具时序与语义对齐的特征,然后在频谱图潜在空间上以 CAVP 对齐的视觉特征训练 LDM。CAVP 对齐的特征使 LDM 能够通过交叉注意力模块捕捉更细微的视听关联。我们通过“双重引导”进一步显著提升样本质量。Diff-Foley 在现有大规模 V2A 数据集上取得最先进的 V2A 性能。此外,我们通过下游微调展示了 Diff-Foley 的实际适用性与泛化能力。项目页面:见 https://diff-foley.github.io/

关键词

引用

@article{arxiv.2306.17203,
  title  = {Diff-Foley: Synchronized Video-to-Audio Synthesis with Latent Diffusion Models},
  author = {Simian Luo and Chuanhao Yan and Chenxu Hu and Hang Zhao},
  journal= {arXiv preprint arXiv:2306.17203},
  year   = {2023}
}