中文

DeepSound-V1:从视频生成音频的链式思考方法

代数几何 2025-03-31 v1

摘要

目前,高质量、同步的音频从视频(可选文本)输入生成,依赖于各种多模态联合学习框架。然而,视觉与生成音频之间的精确对齐仍远未令人满意。一个关键因素是开源视频-音频和文本-音频基准数据集中缺乏足够的时序和语义对齐标注。因此,我们提出了一种从视频生成音频的框架,利用多模态大语言模型 (MLLM) 内部的链式思考 (CoT) 机制,实现无需额外标注的逐步推理。此外,构建了一个相应的多模态推理数据集,以促进音频生成的初始推理学习。在实验中,我们展示了该框架在减少生成音频中的错位(voice-over)方面的有效性,并在多个指标上与各种最先进模型实现了具竞争力的性能。评估结果表明,我们提出的方法在多个指标上均优于最先进的方法。具体而言,F DP aSST 指标降低最高可达 10.07%,F DP AN N s 指标降低最高可达 11.62%,F DV GG 指标降低最高可达 38.61%。此外,IS 指标提升最高可达 4.95%,IB-score 指标提升最高可达 6.39%,DeSync 指标降低最高可达 0.89。

关键词

引用

@article{arxiv.2503.22207,
  title  = {Positivity on Blow-up of hyperelliptic surfaces},
  author = {Praveen Kumar Roy},
  journal= {arXiv preprint arXiv:2503.22207},
  year   = {2025}
}

备注

Comments are welcome!