中文

SCNet:用于音乐源分离的稀疏压缩网络

音频与语音处理 2024-01-25 v1

摘要

基于深度学习的方法在音乐源分离方面取得了显著成就。然而,在超宽带音乐源分离中,如何在保持低模型复杂度的同时获得良好的结果仍然具有挑战性。先前的工作要么忽略了子带之间的差异,要么在生成子带特征时未能充分解决信息丢失的问题。在本文中,我们提出了 SCNet,这是一种新颖的频域网络,用于显式地将混合信号的频谱图分割成若干子带,并引入基于稀疏性的编码器来对不同频带进行建模。我们对信息较少的子带使用更高的压缩率,以提高信息密度,并专注于对信息较多的子带进行建模。这样,使用较低的计算消耗即可显著提高分离性能。实验结果表明,所提出的模型在 MUSDB18-HQ 数据集上无需使用额外数据即达到了 9.0 dB 的信号失真比(SDR),优于现有先进方法。具体而言,SCNet 的 CPU 推理时间仅为先前最先进模型之一 HT Demucs 的 48%。

关键词

引用

@article{arxiv.2401.13276,
  title  = {SCNet: Sparse Compression Network for Music Source Separation},
  author = {Weinan Tong and Jiaxu Zhu and Jun Chen and Shiyin Kang and Tao Jiang and Yang Li and Zhiyong Wu and Helen Meng},
  journal= {arXiv preprint arXiv:2401.13276},
  year   = {2024}
}

备注

Accepted by ICASSP 2024