中文

DeepSound-V1:从视频生成音频时的逐步思考方法

声音 2025-03-31 v1 计算机视觉与模式识别 音频与语音处理

摘要

目前,正在使用各种多模态联合学习框架从视频和可选文本输入合成高质量、同步音频。然而,视觉与生成音频域之间的精确对齐仍远未令人满意。一个关键因素是开源视频音频和文本音频基准数据中缺乏足够的时序和语义对齐标注。因此,我们提出了一个从视频生成音频的框架,利用多模态大语言模型(MLLM)内部的链式思维(CoT)以无需额外标注的方式实现逐步推理。此外,构建了一个相应的多模态推理数据集,以促进音频生成的初始推理学习。在实验中,我们展示了该框架在减少生成音频中的错位(voice-over)方面的有效性,并在与各种最先进模型的比较中实现了竞争性能。评估结果表明,所提出的方法在多个指标上均优于最先进的方法。具体而言,F DP aSST指标降低了最高可达10.07%,F DP AN N s指标降低了最高可达11.62%,F DV GG指标降低了最高可达38.61%。此外,IS指标提高了最高可达4.95%,IB-score指标提高了最高可达6.39%,DeSync指标降低了最高可达0.89%。

关键词

引用

@article{arxiv.2503.22208,
  title  = {DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos},
  author = {Yunming Liang and Zihao Chen and Chaofan Ding and Xinhan Di},
  journal= {arXiv preprint arXiv:2503.22208},
  year   = {2025}
}

备注

11 pages, 6 figures