中文

MGE-LDM:用于同时进行音乐生成与音源提取的联合潜在扩散

声音 2025-10-21 v3 机器学习 音频与语音处理

摘要

我们提出了MGE-LDM,一个用于同时进行音乐生成、音源插补和查询驱动音源分离的统一潜在扩散框架。与以往受限于固定乐器类别的方法不同,MGE-LDM在单个紧凑的潜在扩散模型中学习完整混音、子混音和独立音轨的联合分布。在推理时,MGE-LDM能够实现(1)完整混音生成,(2)部分生成(即音源插补),以及(3)任意音源的文本条件提取。通过将分离和插补都表述为潜在空间中的条件修复任务,我们的方法支持对任意乐器音源进行灵活的、与类别无关的操作。值得注意的是,MGE-LDM可以在异构多轨数据集(例如Slakh2100、MUSDB18、MoisesDB)上进行联合训练,而无需依赖预定义的乐器类别。音频样本可在我们的项目页面获取:https://yoongi43.github.io/MGELDM_Samples/。

关键词

引用

@article{arxiv.2505.23305,
  title  = {MGE-LDM: Joint Latent Diffusion for Simultaneous Music Generation and Source Extraction},
  author = {Yunkee Chae and Kyogu Lee},
  journal= {arXiv preprint arXiv:2505.23305},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025