LoVA:长篇视频到音频生成
声音
2024-12-31 v2 多媒体
音频与语音处理
摘要
视频到音频(V2A)生成对于视频编辑和后期处理至关重要,使能够为无声视频创建语义对齐的音频。然而,大多数现有方法仅关注生成短视频片段(小于10秒)的短音频,而对长篇视频输入的场景鲜有关注。对于当前基于UNet的扩散V2A模型而言,在处理长篇音频生成时不可避免地会出现最终拼接音频中的不一致性问题。本文首先强调了长篇V2A问题的重要性。此外,我们提出了LoVA,一个用于长篇视频到音频生成的新模型。基于扩散转换器(DiT)架构,LoVA在生成长篇音频方面比现有的自回归模型和基于UNet的扩散模型更有效。大量客观和主观实验表明,LoVA在10秒V2A基准上实现了与现有方法相当的性能,并在使用长篇视频输入的基准上超过了所有其他基线方法。
引用
@article{arxiv.2409.15157,
title = {LoVA: Long-form Video-to-Audio Generation},
author = {Xin Cheng and Xihua Wang and Yihan Wu and Yuyue Wang and Ruihua Song},
journal= {arXiv preprint arXiv:2409.15157},
year = {2024}
}
备注
Accepted by ICASSP 2025