用户引导的生成式源分离
声音
2025-08-06 v1 人工智能
音频与语音处理
摘要
音乐源分离(MSS)旨在从混合信号中提取单个乐器源。虽然大多数现有方法聚焦于广泛采用的四层级分离方案(人声、低音、鼓及其他乐器),但这种方法缺乏满足实际应用需求的灵活性。为此,本文提出GuideSep——一种基于扩散模型的MSS模型, Capable of instrument-agnostic separation beyond the four-stem setup。GuideSep在多个输入上进行条件化:一种波形模仿条件,可通过哼唱或演奏目标旋律轻杧提供;以及旋度-频谱域掩码,为分离提供额外指导。不同于依赖固定类别标签或声音查询的先前方法,我们的条件方案结合生成方法,提供更大的灵活性和适用性。此外,我们设计了一个使用相同模型架构的掩码预测基线,用于系统比较预测与生成方法。我们的客观与主观评估表明,GuideSep实现了高质量分离,同时实现了更灵活的乐器提取,凸显了用户参与扩散式生成过程在MSS中潜在的可能性。我们的代码和演示页面已公开:https://yutongwen.github.io/GuideSep/。
引用
@article{arxiv.2507.01339,
title = {User-guided Generative Source Separation},
author = {Yutong Wen and Minje Kim and Paris Smaragdis},
journal= {arXiv preprint arXiv:2507.01339},
year = {2025}
}