中文

基于慢快对比对比式音频视觉预训练和直接偏好优化的 MultiSoundGen:用于多事件场景的视频到音频生成

多媒体 2025-11-05 v2 计算机视觉与模式识别 声音

摘要

当前视频到音频 (V2A) 方法在复杂多事件场景中 (视频场景涉及多个声源、声事件或转换) 面临两个 critical 限制:首先,现有方法在精确对齐复杂语义信息以及快速动态特征方面存在挑战;其次,基础训练缺乏对语义-时间对齐和音频质量的定量偏好优化。因此,无法提升混合多事件场景中集成生成质量。为解决这些核心限制,本研究提出了一种新型 V2A 框架:MultiSoundGen。我们将直接偏好优化 (DPO) 引入 V2A 领域,利用音频视觉预训练 (AVP) 以提升复杂多事件场景下的性能。我们的贡献包括两个关键创新点:第一个是慢快对比音频视觉预训练 (SF-CAVP),这是一种具有统一双流体结构的首个 AVP 模型。SF-CAVP 显式对齐音频视觉数据的核心语义表征和快速动态特征,以处理多事件复杂度;第二个,我们将 DPO 方法集成到 V2A 任务中,提出 AVP-Ranked Preference Optimization (AVP-RPO)。它使用 SF-CAVP 作为奖励模型,对关键语义-时间匹配进行量化和优先级排序,同时提升音频质量。实验表明,MultiSoundGen 在多事件场景中实现了 state-of-the-art (SOTA) 性能,全面提升了分布匹配、音频质量、语义对齐和时间同步方面的表现。演示可在 https://v2aresearch.github.io/MultiSoundGen/ 查看。

关键词

引用

@article{arxiv.2509.19999,
  title  = {MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization},
  author = {Jianxuan Yang and Xiaoran Yang and Lipan Zhang and Xinyue Guo and Zhao Wang and Gongping Huang},
  journal= {arXiv preprint arXiv:2509.19999},
  year   = {2025}
}