高效神经音乐生成
声音
2023-05-26 v1 人工智能
机器学习
音频与语音处理
摘要
近期音乐生成的进展因最先进的 MusicLM 而显著推进,其由三个层级的语言模型(LM)组成,分别用于语义、粗粒度声学与细粒度声学建模。然而,使用 MusicLM 进行采样需依次通过这些语言模型以获得细粒度声学 token,计算开销大且难以实时生成。生成质量与 MusicLM 相当的高效音乐生成仍是一项重大挑战。本文中,我们提出 MeLoDy(M 代表音乐;L 代表 LM;D 代表扩散),一种由 LM 引导的扩散模型,可生成最先进质量的音乐音频,同时将 MusicLM 中采样 10 秒或 30 秒音乐的前向传播分别减少 95.7% 或 99.6%。MeLoDy 继承 MusicLM 中最高层级的 LM 用于语义建模,并应用一种新颖的双路径扩散(DPD)模型与音频 VAE-GAN,将条件语义 token 高效解码为波形。DPD 被提出以在每个去噪步通过交叉注意力将语义信息有效融入潜变量片段,从而同时建模粗粒度与细粒度声学。我们的实验结果表明了 MeLoDy 的优越性,不仅体现在采样速度与可无限续生成的实用优势上,也体现在其最先进的音乐性、音频质量与文本相关性上。我们的样本可在 https://Efficient-MeLoDy.github.io/ 获取。
引用
@article{arxiv.2305.15719,
title = {Efficient Neural Music Generation},
author = {Max W. Y. Lam and Qiao Tian and Tang Li and Zongyu Yin and Siyuan Feng and Ming Tu and Yuliang Ji and Rui Xia and Mingbo Ma and Xuchen Song and Jitong Chen and Yuping Wang and Yuxuan Wang},
journal= {arXiv preprint arXiv:2305.15719},
year = {2023}
}