检索增强的文本到音频生成
声音
2024-01-08 v2 人工智能
多媒体
音频与语音处理
摘要
尽管文本到音频(TTA)生成近期取得进展,我们表明在最先进的模型(如AudioLDM)上,若训练于类分布不平衡的数据集(如AudioCaps),其生成性能存在偏置。具体而言,它们擅长生成常见音频类,而在罕见类上表现不佳,从而降低了整体生成性能。我们将此问题称为长尾文本到音频生成。为应对该问题,我们提出一种简单的TTA模型检索增强方法。具体地,给定输入文本提示,我们首先利用对比语言音频预训练(CLAP)模型检索相关的文本-音频对。检索到的音频-文本数据特征随后用作附加条件以引导TTA模型的学习。我们用所提方法增强AudioLDM,并将所得增强系统记为Re-AudioLDM。在AudioCaps数据集上,Re-AudioLDM取得了1.37的state-of-the-art Frechet Audio Distance(FAD),大幅优于现有方法。此外,我们展示Re-AudioLDM能为复杂场景、罕见音频类甚至未见过的音频类型生成逼真音频,表明其在TTA任务中的潜力。
引用
@article{arxiv.2309.08051,
title = {Retrieval-Augmented Text-to-Audio Generation},
author = {Yi Yuan and Haohe Liu and Xubo Liu and Qiushi Huang and Mark D. Plumbley and Wenwu Wang},
journal= {arXiv preprint arXiv:2309.08051},
year = {2024}
}
备注
Accepted by ICASSP 2024