CWS-PResUNet:基于通道级子带相位感知 ResUNet 的音乐源分离
声音
2021-12-10 v1 人工智能
音频与语音处理
摘要
近年来,音乐源分离(MSS)在深度学习模型的推动下取得了积极进展。许多 MSS 模型通过估计有界比率掩蔽并复用混合信号的相位来在频谱图上进行分离。当使用卷积神经网络(CNN)时,在卷积过程中频谱图内的权重通常是共享的,而未考虑频带之间的不同模式。在本研究中,我们提出了一种新的 MSS 模型——通道级子带相位感知 ResUNet(CWS-PResUNet),将信号分解为子带并为每个源估计无界复数理想比率掩蔽(cIRM)。CWS-PResUNet 利用通道级子带(CWS)特征来限制频谱图上不必要的全局权重共享,并降低计算资源消耗。节省下来的计算成本和内存反过来可以支持更大的架构。在 MUSDB18HQ 测试集上,我们提出了一个 276 层的 CWS-PResUNet,并在人声上取得了 8.92 的信号失真比(SDR)分数,达到了最先进(SoTA)性能。通过结合 CWS-PResUNet 和 Demucs,我们的 ByteMSS 系统在 2021 年 ISMIR 音乐分轨(MDX)挑战赛受限训练数据赛道(排行榜 A)中,人声得分排名第 2,平均得分排名第 5。我们的代码和预训练模型公开于:https://github.com/haoheliu/2021-ISMIR-MSS-Challenge-CWS-PResUNet
引用
@article{arxiv.2112.04685,
title = {CWS-PResUNet: Music Source Separation with Channel-wise Subband Phase-aware ResUNet},
author = {Haohe Liu and Qiuqiang Kong and Jiafeng Liu},
journal= {arXiv preprint arXiv:2112.04685},
year = {2021}
}
备注
Published at MDX Workshop @ ISMIR 2021