VinTAGe:面向整体音频生成的视频与文本联合条件化
计算机视觉与模式识别
2024-12-17 v1 多媒体
声音
音频与语音处理
摘要
音频生成的最新进展主要集中在文本到音频 (T2A) 和视频到音频 (V2A) 任务上。然而,T2A 或 V2A 方法无法生成整体声音(屏幕内和屏幕外)。这是因为 T2A 无法生成与屏幕内对象对齐的声音,而 V2A 无法生成语义完整的声音(缺失屏幕外声音)。在这项工作中,我们处理整体音频生成的任务:给定一个视频和一个文本提示,我们旨在生成与视频时间同步且与文本和视频语义对齐的屏幕内和屏幕外声音。先前的联合文本和视频到音频生成方法通常存在模态偏差,偏向其中一种模态。为了克服这一局限性,我们引入了 VinTAGe,这是一个基于流的 Transformer 模型,联合考虑文本和视频以指导音频生成。我们的框架包含两个关键组件:一个视觉-文本编码器和一个联合 VT-SiT 模型。为了减少模态偏差并提高生成质量,我们采用预训练的单模态文本到音频和视频到音频生成模型进行额外指导。由于缺乏合适的基准,我们还引入了 VinTAGe-Bench,这是一个包含 636 个视频-文本-音频对的数据集,其中包含屏幕内和屏幕外声音。我们在 VinTAGe-Bench 上的综合实验表明,联合文本和视觉交互对于整体音频生成是必要的。此外,VinTAGe 在 VGGSound 基准上取得了 SOTA 结果。我们的源代码和预训练模型将被发布。演示地址:https://www.youtube.com/watch?v=QmqWhUjPkJI。
引用
@article{arxiv.2412.10768,
title = {VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation},
author = {Saksham Singh Kushwaha and Yapeng Tian},
journal= {arXiv preprint arXiv:2412.10768},
year = {2024}
}