DreamFoley:面向高保真视频到音频生成的可扩展视觉语言模型
声音
2025-12-09 v1 多媒体
摘要
近期视频生成技术在视觉内容保真度方面取得了显著进展。然而,缺乏同步音频严重削弱了沉浸式体验,限制了这些技术的实际应用。为此,已有若干前沿工作探索了扩散变换器架构用于生成符合情境的视频同步音频,包括 Kling-foley、HunyuanVideo-foley 和 Thinksound。与现有工作不同,本文引入一种自回归音频生成架构(DreamFoley),利用大型视觉语言模型(VLMs)联合建模视频、音频和文本三种模态之间的顺序互动。我们的做法包含双视觉编码器模块,有效捕捉音频对齐和文本对齐的视觉特征。此外,我们采用延迟模式生成方案的残差向量量化音频标记,以平衡训练效率与音频质量之间的权衡。我们还将无分类器引导策略引入 VLMs,以引导生成音频的质量。进一步,我们建立了高效的数据生产管道以扩大音视频文本三元组的收集。最后,在多个主流基准上进行大量实验验证,证明了我们模型的有效性,实现了令人满意的性能。我们希望本研究的发现为未来视频到音频生成研究提供坚实基础。我们也发布了先前缺失的音视频文本描述,旨在便利后续研究者进行更方便和有效的评估和比较。
引用
@article{arxiv.2512.06022,
title = {DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation},
author = {Fu Li and Weichao Zhao and You Li and Zhichao Zhou and Dongliang He},
journal= {arXiv preprint arXiv:2512.06022},
year = {2025}
}
备注
10 pages; Bytedance