中文

通过多步骤类链路思维引导与组合偏好优化提升 Flow Matching V2A 模型生成质量

声音 2025-03-31 v1 计算机视觉与模式识别 音频与语音处理

摘要

从视频和文本提示生成高质量的音效需要在语义和时间上实现视觉与音频领域的精确对齐,并为专业音频生成提供逐步指导。然而,当前最先进的视频引导音频生成模型在生成通用和专业用例的高质量音频方面存在不足。为此,我们引入了一个多阶段、多模态的端到端生成框架,采用类链路思维 (CoT-like) 指导学习,称为 Chain-of-Perform (CoP)。首先,我们采用基于 Transformer 的网络架构实现 CoP 指导,实现通用和专业音频的生成。其次,我们实施遵循逐步指导的多阶段训练框架,以确保高质量音效的生成。第三,我们开发了一个由视频引导的 CoP 多模态数据集,以支持逐步音效生成。评估结果表明,与最先进模型相比,我们的方法在 VGGSound、PianoYT-2h 和 Piano-10h 等多个数据集上实现了显著提升:VGGSound 上 FAD 从 0.79 降至 0.74 (+6.33%),CLIP 从 16.12 提升至 17.70 (+9.80%);PianoYT-2h 上 SI-SDR 从 1.98dB 提升至 3.35dB (+69.19%),MOS 从 2.94 提升至 3.49 (+18.71%);Piano-10h 上 SI-SDR 从 2.22dB 提升至 3.21dB (+44.59%),MOS 从 3.07 提升至 3.42 (+11.40%)。

关键词

引用

@article{arxiv.2503.22200,
  title  = {Enhance Generation Quality of Flow Matching V2A Model via Multi-Step CoT-Like Guidance and Combined Preference Optimization},
  author = {Haomin Zhang and Sizhe Shan and Haoyu Wang and Zihao Chen and Xiulong Liu and Chaofan Ding and Xinhan Di},
  journal= {arXiv preprint arXiv:2503.22200},
  year   = {2025}
}

备注

10 pages, 4 figures