用于音乐源分离的多通道U-Net
声音
2020-09-07 v3 信息检索
机器学习
多媒体
摘要
音乐源分离的一个相当直接的方法是训练独立模型,其中每个模型专用于估计仅一种特定源。训练单一模型估计多个源通常表现不如独立专用模型。然而,Conditioned U-Net(C-U-Net)使用控制机制训练单一模型进行多源分离,并试图达到与专用模型相当的性能。我们提出使用加权多任务损失训练的多通道U-Net(M-U-Net)作为C-U-Net的替代。我们研究了多任务损失的两种加权策略:1)动态加权平均(DWA),以及2)基于能量的加权(EBW)。DWA通过跟踪各任务训练期间损失的变化率确定权重。EBW旨在消除因混合物中各源能量水平差异引起的训练偏差影响。相较C-U-Net,我们的方法具有三重优势:1)每轮有效训练迭代更少,2)可训练网络参数更少(无控制参数),以及3)推理时处理更快。我们的方法以低得多的训练成本实现了与C-U-Net及专用U-Net相当的性能。
引用
@article{arxiv.2003.10414,
title = {Multi-channel U-Net for Music Source Separation},
author = {Venkatesh S. Kadandale and Juan F. Montesinos and Gloria Haro and Emilia Gómez},
journal= {arXiv preprint arXiv:2003.10414},
year = {2020}
}
备注
The paper has been accepted at IEEE MMSP2020. Project Page: https://vskadandale.github.io/multi-channel-unet