Smooth-Foley:语义引导下的视频到音频连续音频生成
声音
2024-12-25 v1 人工智能
音频与语音处理
摘要
视频到音频(V2A)生成任务因其在多媒体领域生产 Foley 音效的实用性而受到关注。语义条件和时间条件被输入生成模型以指示声音事件及其发生时间。近期研究在合成沉浸式同步音频方面面临挑战,尤其是处理视觉要素持续变化的视频。时间条件不够准确,低分辨率语义条件会加剧问题。为解决这些挑战,我们提出 Smooth-Foley,一种从文本标签持续提供语义引导的 V2A 生成模型,增强语义和时间对齐。我们训练两个适配器利用预训练文本到音频生成模型。帧适配器集成高分辨率帧级视频特征,时间适配器整合来自视觉帧与文本标签相似性的时间条件。文本标签语义引导的融合实现了精确的音视频对齐。我们进行了大量定量和定性实验。结果表明,Smooth-Foley 在连续音频场景和通用场景中均优于现有模型。通过语义引导,生成的音频质量更高,更符合物理规律。
引用
@article{arxiv.2412.18157,
title = {Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance},
author = {Yaoyun Zhang and Xuenan Xu and Mengyue Wu},
journal= {arXiv preprint arXiv:2412.18157},
year = {2024}
}