TA-V2A:文本辅助的视频到音频生成
计算机视觉与模式识别
2025-03-17 v1 多媒体
摘要
随着人工智能生成内容(AIGC)的不断演进,视频到音频(V2A)生成已成为具有前景应用的关键领域,广泛应用于多媒体编辑、增强现实和自动内容创建。虽然 Transformer 和扩散模型已推进音频生成,但从视频中提取精确语义信息的挑战仍然存在,因当前模型常依赖帧级特征导致丢失序列上下文。为此,我们提出了 TA-V2A 方法,通过整合语言、音频和视频特征来提高潜在空间中的语义表示。通过融入大语言模型实现视频理解,我们的方法利用文本指导丰富语义表达。我们的基于扩散模型的系统利用自动文本调制来提高推理质量和效率,通过文本引导界面实现个性化控制。这种整合既增强了语义表达,又确保了时间对齐,导致更准确、更连贯的视频到音频生成。
引用
@article{arxiv.2503.10700,
title = {TA-V2A: Textually Assisted Video-to-Audio Generation},
author = {Yuhuan You and Xihong Wu and Tianshu Qu},
journal= {arXiv preprint arXiv:2503.10700},
year = {2025}
}