中文

LD-LAudio-V1:视频到长形式音频生成扩展版的双轻量适配器

声音 2025-08-18 v1 人工智能 计算机视觉与模式识别 音频与语音处理

摘要

从视频内容生成高质量且时间上与之同步的音频对于视频编辑和后期制作任务至关重要,能够为无声视频创建语义对齐音频。然而,大多数现有方法仅聚焦于时长不足10秒的短视频段音频生成,或依赖噪声数据集进行长视频音频生成。为解决这些限制,我们提出LD-LAudio-V1,这是一种针对视频到音频模型的扩展版本,采用双轻量适配器以实现长形式音频生成。此外,我们发布了一个干净且人工标注的视频到音频数据集,包含无噪声或伪影的纯音效。我们的方法在保持计算效率的同时,显著减少了拼接伪影和时间不一致性。与直接使用短训练视频进行微调相比,LD-LAudio-V1在多个指标上实现了显著提升:FDpasstFD_{\text{passt}} 450.00 \rightarrow 327.29(+27.27%),FDpannsFD_{\text{panns}} 34.88 \rightarrow 22.68(+34.98%),FDvggFD_{\text{vgg}} 3.75 \rightarrow 1.28(+65.87%),KLpannsKL_{\text{panns}} 2.49 \rightarrow 2.07(+16.87%),KLpasstKL_{\text{passt}} 1.78 \rightarrow 1.53(+14.04%),ISpannsIS_{\text{panns}} 4.17 \rightarrow 4.30(+3.12%),IBscoreIB_{\text{score}} 0.25 \rightarrow 0.28(+12.00%),EnergyΔ10msEnergy\Delta10\text{ms} 0.3013 \rightarrow 0.1349(+55.23%),EnergyΔ10ms(vs.GT)Energy\Delta10\text{ms(vs.GT)} 0.0531 \rightarrow 0.0288(+45.76%),以及 Sem.Rel.Sem.\,Rel. 2.73 \rightarrow 3.28(+20.15%)。我们的数据集旨在促进长形式视频到音频生成领域的进一步研究,已提供于 https://github.com/deepreasonings/long-form-video2audio。

关键词

引用

@article{arxiv.2508.11074,
  title  = {LD-LAudio-V1: Video-to-Long-Form-Audio Generation Extension with Dual Lightweight Adapters},
  author = {Haomin Zhang and Kristin Qi and Shuxin Yang and Zihao Chen and Chaofan Ding and Xinhan Di},
  journal= {arXiv preprint arXiv:2508.11074},
  year   = {2025}
}

备注

Gen4AVC@ICCV: 1st Workshop on Generative AI for Audio-Visual Content Creation