FoleyGen:视觉引导的音频生成
音频与语音处理
2023-09-20 v1 多媒体
声音
摘要
音频生成的最新进展由大规模深度学习模型与海量数据集的演进所推动。然而,视频到音频(V2A)生成任务仍具挑战,主要源于高维视觉与听觉数据间复杂的关系,以及时间同步相关的难题。本研究中,我们引入 FoleyGen,一个基于语言建模范式的开放域 V2A 生成系统。FoleyGen 利用现成神经音频编解码器实现波形与离散 token 的双向转换。音频 token 的生成由单一 Transformer 模型促成,该模型以视觉编码器提取的视觉特征为条件。V2A 生成中的普遍问题是生成音频与视频中可见动作错位。为此,我们探索了三种新颖视觉注意力机制。我们进一步对多个视觉编码器(各自在单模态或多模态任务上预训练)进行了详尽评估。在 VGGSound 数据集上的实验结果表明,我们提出的 FoleyGen 在所有客观指标与人工评估上均优于先前系统。
引用
@article{arxiv.2309.10537,
title = {FoleyGen: Visually-Guided Audio Generation},
author = {Xinhao Mei and Varun Nagaraja and Gael Le Lan and Zhaoheng Ni and Ernie Chang and Yangyang Shi and Vikas Chandra},
journal= {arXiv preprint arXiv:2309.10537},
year = {2023}
}