通过 Mel 量化-连续体分解的同步视频至音频生成
声音
2025-03-11 v1 计算机视觉与模式识别
音频与语音处理
摘要
视频至音频生成对于合成与无声视频有效同步的逼真音频轨道至关重要。遵循从视频中提取能够精确控制成熟的文本至音频生成扩散模型的关键信号的视角,本文提出了一种名为 Mel 量化-连续体分解(Mel-QCD)的新方法,展示了如何在完整性和复杂性之间平衡 Mel 频谱图的表示。我们将 Mel 频谱图分解为三种不同类型的信号,对其采用量化或连续性处理,从而可以通过设计的视频到全模态(V2X)预测器从视频中有效预测它们。然后,将预测的信号重组并连同文本反转设计一起输入到 ControlNet 中,以控制音频生成过程。我们提出的 Mel-QCD 方法在八个指标上展现了最先进的性能,评估了质量、同步性和语义一致性等维度。我们的代码和演示将发布于 https://wjc2830.github.io/MelQCD/。
引用
@article{arxiv.2503.06984,
title = {Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition},
author = {Juncheng Wang and Chao Xu and Cheng Yu and Lei Shang and Zhe Hu and Shujun Wang and Liefeng Bo},
journal= {arXiv preprint arXiv:2503.06984},
year = {2025}
}
备注
Accepted to CVPR-25