Demucs:利用额外无标签重混数据提取音乐声源的深度学习模型
声音
2019-09-04 v1 机器学习
音频与语音处理
机器学习
摘要
我们研究利用深度学习进行音乐源分离的问题,涉及四种已知声源:鼓、贝斯、人声和其他伴奏。最先进的方法在混合谱图上预测软掩码,而在标准MusDB基准上衡量,基于波形的方法则落后。我们的贡献有两点。(i) 我们引入了一个简单的卷积与循环模型,在波形上以1.6个SDR(信号失真比)点优于最先进的波形模型Wave-U-Net。(ii) 我们提出了一种利用无标签音乐的新方案。我们训练第一个模型,从无标签音轨中提取至少一路声源静音的部分,例如无贝斯。我们将此提取部分与取自监督数据集的贝斯线重新混音,构成一个弱监督的新训练样本。结合我们的架构与方案,我们表明波形方法可达到与谱图方法相近的水平。
引用
@article{arxiv.1909.01174,
title = {Demucs: Deep Extractor for Music Sources with extra unlabeled data remixed},
author = {Alexandre Défossez and Nicolas Usunier and Léon Bottou and Francis Bach},
journal= {arXiv preprint arXiv:1909.01174},
year = {2019}
}