中文

Demucs:利用额外无标签重混数据提取音乐声源的深度学习模型

声音 2019-09-04 v1 机器学习 音频与语音处理 机器学习

摘要

我们研究利用深度学习进行音乐源分离的问题,涉及四种已知声源:鼓、贝斯、人声和其他伴奏。最先进的方法在混合谱图上预测软掩码,而在标准MusDB基准上衡量,基于波形的方法则落后。我们的贡献有两点。(i) 我们引入了一个简单的卷积与循环模型,在波形上以1.6个SDR(信号失真比)点优于最先进的波形模型Wave-U-Net。(ii) 我们提出了一种利用无标签音乐的新方案。我们训练第一个模型,从无标签音轨中提取至少一路声源静音的部分,例如无贝斯。我们将此提取部分与取自监督数据集的贝斯线重新混音,构成一个弱监督的新训练样本。结合我们的架构与方案,我们表明波形方法可达到与谱图方法相近的水平。

关键词

引用

@article{arxiv.1909.01174,
  title  = {Demucs: Deep Extractor for Music Sources with extra unlabeled data remixed},
  author = {Alexandre Défossez and Nicolas Usunier and Léon Bottou and Francis Bach},
  journal= {arXiv preprint arXiv:1909.01174},
  year   = {2019}
}