Kling-Foley:用于高质量视频到音频生成的多模态扩散转换器
音频与语音处理
2025-06-25 v1 人工智能
计算与语言
声音
摘要
我们提出Kling-Foley,一个大规模多模态视频到音频生成模型,用于合成与视频内容同步的高质量音频。在Kling-Foley中,我们引入多模态扩散转换器来建模视频、音频和文本模态之间的相互作用,并结合视觉语义表示模块和音频-视觉同步模块以增强对齐能力。具体而言,这些模块在帧级将视频条件与潜在音频元素对齐,从而提高语义对齐和音频-视觉同步。结合文本条件,这种集成方法可实现精确的视频匹配音效生成。此外,我们提出了一种通用潜在音频编解码器,可在各种场景(如音效、语音、歌唱和音乐)中实现高质量建模。我们采用立体渲染方法,使合成音频具有空间感。同时,为了弥补开源基准的类型和注释不完整, 我们也开源了一个工业水平的基准Kling-Audio-Eval。我们的实验表明,Kling-Foley在分布匹配、语义对齐、时间对齐和音频质量等方面实现了基于公共模型的新的音频-视觉SOTA性能。
引用
@article{arxiv.2506.19774,
title = {Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation},
author = {Jun Wang and Xijuan Zeng and Chunyu Qiang and Ruilong Chen and Shiyao Wang and Le Wang and Wangjing Zhou and Pengfei Cai and Jiahui Zhao and Nan Li and Zihan Li and Yuzhe Liang and Xiaopeng Wang and Haorui Zheng and Ming Wen and Kang Yin and Yiran Wang and Nan Li and Feng Deng and Liang Dong and Chen Zhang and Di Zhang and Kun Gai},
journal= {arXiv preprint arXiv:2506.19774},
year = {2025}
}