潜在 CLAP 损失助力更优拟音合成
音频与语音处理
2024-10-15 v1
摘要
拟音生成,即为多媒体创作音频的艺术,近期通过文本条件的潜在扩散模型取得了显著进展。这些系统使用多模态文本-音频表示模型,如对比语言-音频预训练(Contrastive Language-Audio Pretraining, CLAP),其目标是将对应的音频和文本提示映射到联合嵌入空间。AudioLDM,一个文本到音频模型,是 DCASE2023 任务 7 拟音合成挑战赛的获胜者。该获胜系统针对特定音频类别微调了模型,并在推理时使用输出音频与输入文本之间的 CLAP 相似度分数应用了后滤波方法,这需要生成额外样本,从而降低了数据生成效率。我们引入了一个新的损失项,以在无需后滤波的情况下增强 AudioLDM 中的拟音生成。该损失项使用一个基于 CLAP 模式的新模块——潜在 CLAP 编码器——将潜在扩散输出与真实音频在共享的 CLAP 嵌入空间中对齐。我们的实验表明,该方法有效降低了生成音频的弗雷歇音频距离(FAD)分数,并消除了后滤波的需要,从而提高了生成效率。
引用
@article{arxiv.2403.12182,
title = {Latent CLAP Loss for Better Foley Sound Synthesis},
author = {Tornike Karchkhadze and Hassan Salami Kavaki and Mohammad Rasool Izadi and Bryce Irvin and Mikolaj Kegler and Ari Hertz and Shuo Zhang and Marko Stamenovic},
journal= {arXiv preprint arXiv:2403.12182},
year = {2024}
}