我听见你的真实色彩:图像引导的音频生成
声音
2023-02-28 v2 音频与语音处理
摘要
我们提出 Im2Wav,一种图像引导的开放域音频生成系统。给定一张输入图像或一组图像序列,Im2Wav 生成语义相关的声音。Im2Wav 基于两个 Transformer 语言模型,它们在一个由基于 VQ-VAE 的模型获得的层次化离散音频表示上运行。我们首先使用语言模型生成低层音频表示,随后利用另一个语言模型对音频 token 进行上采样,以生成高保真音频样本。我们使用预训练 CLIP(Contrastive Language-Image Pre-training,对比语言-图像预训练)嵌入的丰富语义作为视觉表示来条件化语言模型。此外,为将生成过程引导至条件图像,我们应用了无分类器引导方法。结果表明,Im2Wav 在保真度与相关性的评价指标上均显著优于所评估的基线方法。另外,我们提供了消融研究以更好地评估各方法组件对整体性能的影响。最后,为更好地评估图像到音频模型,我们提出了一个域外图像数据集,记为 ImageHear。ImageHear 可用作评估未来图像到音频模型的基准。样本与代码可在原稿中找到。
引用
@article{arxiv.2211.03089,
title = {I Hear Your True Colors: Image Guided Audio Generation},
author = {Roy Sheffer and Yossi Adi},
journal= {arXiv preprint arXiv:2211.03089},
year = {2023}
}
备注
Accepted at ICASSP 2023