MGE-LDM:用于同时进行音乐生成与音源提取的联合潜在扩散
声音
2025-10-21 v3 机器学习
音频与语音处理
摘要
我们提出了MGE-LDM,一个用于同时进行音乐生成、音源插补和查询驱动音源分离的统一潜在扩散框架。与以往受限于固定乐器类别的方法不同,MGE-LDM在单个紧凑的潜在扩散模型中学习完整混音、子混音和独立音轨的联合分布。在推理时,MGE-LDM能够实现(1)完整混音生成,(2)部分生成(即音源插补),以及(3)任意音源的文本条件提取。通过将分离和插补都表述为潜在空间中的条件修复任务,我们的方法支持对任意乐器音源进行灵活的、与类别无关的操作。值得注意的是,MGE-LDM可以在异构多轨数据集(例如Slakh2100、MUSDB18、MoisesDB)上进行联合训练,而无需依赖预定义的乐器类别。音频样本可在我们的项目页面获取:https://yoongi43.github.io/MGELDM_Samples/。
引用
@article{arxiv.2505.23305,
title = {MGE-LDM: Joint Latent Diffusion for Simultaneous Music Generation and Source Extraction},
author = {Yunkee Chae and Kyogu Lee},
journal= {arXiv preprint arXiv:2505.23305},
year = {2025}
}
备注
Accepted by NeurIPS 2025