基于深度 ResUNet 解耦幅度与相位估计的音乐源分离
声音
2021-09-14 v1 音频与语音处理
摘要
基于深度神经网络的方法已成功应用于音乐源分离。它们通常学习从混合谱图到一组仅含幅度的源谱图的映射。这种方法有几个局限:1)其不正确的相位重建降低了性能;2)它将掩码幅度限制在 0 到 1 之间,而我们观察到一个流行数据集 MUSDB18 中 22% 的时频 bin 具有大于~1 的理想比率掩码值;3)其在极深架构上的潜力未被充分探索。我们提出的系统旨在克服这些局限。首先,我们提出通过估计复理想比率掩码(cIRM)来估计相位,并将 cIRM 的估计解耦为幅度估计与相位估计。其次,我们扩展分离方法以有效允许掩码幅度大于 1。最后,我们提出了一个多达 143 层的残差 UNet 架构。我们提出的系统在 MUSDB18 数据集上取得了 SOTA(state-of-the-art,最先进)的 MSS 结果,尤其在人声上达到 8.98~dB 的 SDR,优于先前最佳的 7.24~dB。源代码见:https://github.com/bytedance/music_source_separation
引用
@article{arxiv.2109.05418,
title = {Decoupling Magnitude and Phase Estimation with Deep ResUNet for Music Source Separation},
author = {Qiuqiang Kong and Yin Cao and Haohe Liu and Keunwoo Choi and Yuxuan Wang},
journal= {arXiv preprint arXiv:2109.05418},
year = {2021}
}
备注
6 pages