中文

基于潜在扩散的多音源音乐生成

音频与语音处理 2025-06-18 v4 机器学习 声音

摘要

大多数音乐生成模型直接生成单一的音乐混合。为了允许更灵活和可控的生成,多音源扩散模型(MSDM)被提出,将音乐建模为多个乐器音源(例如钢琴、鼓、贝斯和吉他)的混合。其目标是使用一个单一的扩散模型生成相互协调的音乐音源,然后将它们混合形成音乐。尽管 MSDM 具有这些能力,但它无法生成旋律丰富的音乐,并且经常产生空洞的声音。其波形扩散方法也引入了显著的高斯噪声伪影,损害了音频质量。为此,我们引入了多音源潜在扩散模型(MSLDM),该模型采用变分自编码器(VAEs)将每个乐器音源编码到不同的潜在表示中。通过在所有音乐音源上训练 VAE,我们有效地在“音源潜在”中捕获了每个音源的独特特征。这些音源潜在被拼接起来,我们的扩散模型学习这个联合潜在空间。这种方法通过利用 VAE 的潜在压缩和噪声鲁棒性,显著增强了音乐的整体和部分生成。压缩的音源潜在也促进了更高效的生成。主观听觉测试和弗雷歇音频距离(FAD)分数证实,我们的模型优于 MSDM,展示了其在音乐生成系统中实用且增强的适用性。我们还强调,对音源进行建模比直接对音乐混合建模更有效。代码和模型可在 https://github.com/XZWY/MSLDM 获取。演示可在 https://xzwy.github.io/MSLDMDemo/ 获取。

关键词

引用

@article{arxiv.2409.06190,
  title  = {Multi-Source Music Generation with Latent Diffusion},
  author = {Zhongweiyang Xu and Debottam Dutta and Yu-Lin Wei and Romit Roy Choudhury},
  journal= {arXiv preprint arXiv:2409.06190},
  year   = {2025}
}