中文

AudioLDM 2:基于自监督预训练学习整体音频生成

声音 2024-05-14 v3 人工智能 多媒体 音频与语音处理 信号处理

摘要

尽管音频生成在语音、音乐与音效等不同类型音频间存在共性,但为每种类型设计模型需仔细考量可能与其他类型显著不同的特定目标与偏置。为使我们更接近音频生成的统一视角,本文提出一种对语音、音乐与音效生成采用相同学习方法的框架。我们的框架引入了一种称为“音频语言”(LOA)的通用音频表示。任何音频均可基于AudioMAE(一种自监督预训练表示学习模型)翻译为LOA。在生成过程中,我们利用GPT-2模型将任意模态翻译为LOA,并以LOA为条件、通过潜扩散模型执行自监督音频生成学习。所提框架自然带来了诸如上下文学习能力和可复用的自监督预训练AudioMAE与潜扩散模型等优势。在文本到音频、文本到音乐与文本到语音的主要基准上的实验展示了相较于先前方法的最先进或具竞争力的性能。我们的代码、预训练模型与演示见https://audioldm.github.io/audioldm2。

关键词

引用

@article{arxiv.2308.05734,
  title  = {AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining},
  author = {Haohe Liu and Yi Yuan and Xubo Liu and Xinhao Mei and Qiuqiang Kong and Qiao Tian and Yuping Wang and Wenwu Wang and Yuxuan Wang and Mark D. Plumbley},
  journal= {arXiv preprint arXiv:2308.05734},
  year   = {2024}
}

备注

Accepted by IEEE/ACM Transactions on Audio, Speech and Language Processing. Project page is https://audioldm.github.io/audioldm2