CLIPSonic:利用无标注视频与预训练语言-视觉模型的文本到音频合成
声音
2023-07-25 v2 机器学习
多媒体
音频与语音处理
信号处理
摘要
近期研究利用大量配对的文本-音频数据开展文本到音频合成。然而,带有高质量文本标注的音频记录难以获取。本文中,我们采用无标注视频与预训练语言-视觉模型来处理文本到音频合成。我们提出通过以视觉模态作为桥梁来学习所需的文本-音频对应关系。我们训练了一个条件扩散模型,以由预训练对比语言-图像预训练(CLIP)模型编码的视频帧为条件,生成视频的音频轨。在测试时,我们首先尝试进行零样本模态迁移,并用 CLIP 编码的文本查询来条件化扩散模型。然而,我们观察到相对于图像查询的明显性能下降。为缩小此差距,我们进一步采用预训练的扩散先验模型,给定 CLIP 文本嵌入生成 CLIP 图像嵌入。我们的结果显示了所提方法的有效性,且预训练扩散先验能够缩小模态迁移差距。虽然我们聚焦于文本到音频合成,所提模型也可从图像查询生成音频,并在主观听感测试中展现出与最先进的图像到音频合成模型相竞争的性能。本研究提供了一种利用视频中自然存在的视听对应关系以及预训练语言-视觉模型能力的文本到音频合成新方向。
引用
@article{arxiv.2306.09635,
title = {CLIPSonic: Text-to-Audio Synthesis with Unlabeled Videos and Pretrained Language-Vision Models},
author = {Hao-Wen Dong and Xiaoyu Liu and Jordi Pons and Gautam Bhattacharya and Santiago Pascual and Joan Serrà and Taylor Berg-Kirkpatrick and Julian McAuley},
journal= {arXiv preprint arXiv:2306.09635},
year = {2023}
}
备注
Accepted by WASPAA 2023. Demo: https://salu133445.github.io/clipsonic/