中文

面向文本条件音乐扩散模型的广义多源推断

声音 2024-03-19 v1 机器学习 音频与语音处理

摘要

多源扩散模型(MSDM)允许组合式的音乐生成任务:生成一组连贯的声源、创建伴奏以及执行声源分离。尽管具有通用性,它们需要估计声源上的联合分布,这必然需要预分离的音乐数据(此类数据很少可用),并且在训练时固定声源的数量和类型。本文将 MSDM 推广至以文本嵌入为条件的任意时域扩散模型。这些模型不需要分离的数据,因为它们在混合音频上训练,可以参数化任意数量的声源,并允许丰富的语义控制。我们提出了一种推理过程,能够实现声源和伴奏的连贯生成。此外,我们调整了 MSDM 的 Dirac 分离器以执行声源分离。我们在 Slakh2100 和 MTG-Jamendo 上训练的扩散模型上进行了实验,展示了在宽松的数据设置下具有竞争力的生成和分离结果。

关键词

引用

@article{arxiv.2403.11706,
  title  = {Generalized Multi-Source Inference for Text Conditioned Music Diffusion Models},
  author = {Emilian Postolache and Giorgio Mariani and Luca Cosmo and Emmanouil Benetos and Emanuele Rodolà},
  journal= {arXiv preprint arXiv:2403.11706},
  year   = {2024}
}

备注

Accepted at ICASSP 2024