Moûsai:基于长上下文隐扩散的文本到音乐生成
计算与语言
2023-10-25 v3 机器学习
声音
音频与语音处理
摘要
近年来,大型文本生成模型发展迅速;然而,探讨文本与另一种“交流语言”——音乐之间关联的研究甚少。音乐与文本类似,能够传达情感、故事与思想,并拥有其独特的结构与语法。在我们的工作中,我们通过一个高效、富有表现力且能处理长期结构的文本到音乐生成模型来桥接文本与音乐。具体而言,我们开发了 Moûsai,一种级联的两阶段隐扩散模型,可根据文本描述生成数分钟、48kHz 采样率的高质量立体声音乐。此外,我们的模型具有高效率,能够在单块消费级 GPU 上以合理速度实现实时推理。通过实验与性质分析,我们展示了相比现有音乐生成模型,我们的模型在多种标准下的竞争力。最后,为倡导开源文化,我们提供了一系列开源库,希望能促进该领域的未来工作。我们开源如下内容:代码:https://github.com/archinetai/audio-diffusion-pytorch;本文音乐样本:http://bit.ly/44ozWDH;所有模型的所有音乐样本:https://bit.ly/audio-diffusion。
引用
@article{arxiv.2301.11757,
title = {Mo\^usai: Text-to-Music Generation with Long-Context Latent Diffusion},
author = {Flavio Schneider and Ojasv Kamal and Zhijing Jin and Bernhard Schölkopf},
journal= {arXiv preprint arXiv:2301.11757},
year = {2023}
}