中文

众木成林:通过桥接网络改进音乐分离

音频与语音处理 2021-05-12 v4 声音

摘要

本文提出了若干基于深度神经网络(DNNs)的音乐分离改进方法,即多域损失(MDL)与两种组合方案。首先,通过采用 MDL,我们利用音频信号的频域与时域表示。接着,我们通过联合考虑乐器之间的关联来利用它们之间的关系。一方面,我们通过修改网络架构并引入 CrossNet 结构来实现这一点;另一方面,我们通过使用一种新的组合损失(CL)来考虑乐器估计的组合。MDL 与 CL 可轻易应用于许多现有的基于 DNN 的分离方法,因为它们仅仅是损失函数,仅在训练期间使用且不影响推理步骤。实验结果表明,知名且最先进的音乐分离开源库 Open-Unmix (UMX) 的性能可通过采用上述方案得到提升。我们对 UMX 的修改已随本文开源。

关键词

引用

@article{arxiv.2010.04228,
  title  = {All for One and One for All: Improving Music Separation by Bridging Networks},
  author = {Ryosuke Sawata and Stefan Uhlich and Shusuke Takahashi and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2010.04228},
  year   = {2021}
}

备注

The both implementations of our code, i.e., NNabla and PyTorch, are available on this latest paper