中文

用于视频到音频生成的无训练多模态引导

机器学习 2026-05-18 v1 声音

摘要

视频到音频(V2A)生成旨在从无声视频中合成真实且语义对齐的音频,在视频编辑、音效设计和辅助多媒体等领域具有潜在应用。尽管已有方法取得了优异结果,但现有方法要么需要在大型配对数据集上进行昂贵的联合训练,要么依赖成对相似性,这可能无法捕捉全局多模态一致性。在本工作中,我们提出了一种新颖的无训练多模态引导机制,用于 V2A 扩散模型,该机制利用模态嵌入所张成的体积来强制视频、音频和文本之间的统一对齐。所提出的多模态扩散引导(MDG)提供了一个轻量级、即插即用的控制信号,可以应用于任何预训练的音频扩散模型而无需重新训练。在 VGGSound 和 AudioCaps 上的实验表明,我们的 MDG 相比基线方法持续提升了感知质量和多模态对齐,证明了联合多模态引导在 V2A 中的有效性。

关键词

引用

@article{arxiv.2509.24550,
  title  = {Training-Free Multimodal Guidance for Video to Audio Generation},
  author = {Eleonora Grassucci and Giuliano Galadini and Giordano Cicchetti and Aurelio Uncini and Fabio Antonacci and Danilo Comminiello},
  journal= {arXiv preprint arXiv:2509.24550},
  year   = {2026}
}