V2A-Mapper:通过连接基础模型实现视觉到音频生成的轻量方案
计算机视觉与模式识别
2023-12-15 v4 人工智能
多媒体
声音
音频与语音处理
摘要
在一组基础模型(FMs)之上构建人工智能(AI)系统正成为AI研究的新范式。这些从海量数据中学到的表征与生成能力,可轻松适配并迁移至广泛的下游任务,而无需从头重新训练。然而,在涉及音频模态时,跨模态生成中基础模型的应用仍研究不足。另一方面,从视觉输入自动生成语义相关声音是跨模态生成研究中的重要问题。为解决这一视觉到音频(V2A)生成问题,现有方法倾向于使用中等规模数据集从零设计构建复杂系统。本文提出一种轻量解决方案,借助基础模型(具体为CLIP、CLAP与AudioLDM)解决该问题。我们首先考察视觉CLIP与听觉CLAP模型潜空间之间的域鸿沟,随后提出一种简洁而有效的映射机制(V2A-Mapper),通过在CLIP与CLAP空间之间转译视觉输入来弥合域鸿沟。以转译后的CLAP嵌入为条件,采用预训练的音频生成FM AudioLDM生成高保真且与视觉对齐的声音。相较先前方法,我们的方法仅需快速训练V2A-Mapper。我们进一步分析并在V2A-Mapper的选择上开展充分实验,表明生成式映射器在保真度与多样性(FD)上更优,而回归式映射器在相关性(CS)上略优。在两个V2A数据集上的客观与主观评测均显示,相较当前最先进方法,我们所提方法以少训86%的参数取得了FD与CS分别53%和19%的提升。
引用
@article{arxiv.2308.09300,
title = {V2A-Mapper: A Lightweight Solution for Vision-to-Audio Generation by Connecting Foundation Models},
author = {Heng Wang and Jianbo Ma and Santiago Pascual and Richard Cartwright and Weidong Cai},
journal= {arXiv preprint arXiv:2308.09300},
year = {2023}
}
备注
AAAI 2024. Demo page: https://v2a-mapper.github.io/