ERNIE-Music:基于扩散模型的文本到波形音乐生成
声音
2023-09-22 v2 人工智能
计算与语言
多媒体
音频与语音处理
摘要
近年来,对扩散模型日益增长的兴趣推动了图像与语音生成的显著进展。然而,从不受限的文本提示直接合成音乐波形仍是一个相对未被充分探索的领域。为回应这一空白,本文以文本到波形音乐生成模型的形式引入了一项开创性贡献,其以扩散模型的使用为基础。我们的方法关键在于创新性地将自由形式文本提示作为条件因子,以在扩散模型框架内引导波形生成过程。针对文本-音乐平行数据有限的挑战,我们利用网络资源创建数据集,该任务由弱监督技术所便利。此外,我们开展了严格的实证探究,以对比两种不同文本条件提示格式(即音乐标签与无约束文本描述)的效力。该对比分析的结果肯定了我们所提模型在增强文本-音乐相关性方面的优越性能。最后,我们的工作以展示模型在文本到音乐生成中的卓越能力作结。我们进一步证明,我们所生成的波形域音乐在多样性、质量与文本-音乐相关性上大幅优于先前工作。
引用
@article{arxiv.2302.04456,
title = {ERNIE-Music: Text-to-Waveform Music Generation with Diffusion Models},
author = {Pengfei Zhu and Chao Pang and Yekun Chai and Lei Li and Shuohuan Wang and Yu Sun and Hao Tian and Hua Wu},
journal= {arXiv preprint arXiv:2302.04456},
year = {2023}
}
备注
Accepted by AACL demo 2023