中文

CatNet:基于混合音频增强的音乐源分离系统

声音 2021-02-22 v1 音频与语音处理

摘要

音乐源分离(MSS)是将一首音乐作品分离为各个独立声源(如人声与伴奏)的任务。近年来,基于神经网络的方法已被应用于解决 MSS 问题,并可归纳为基于频谱图与基于时域的两类方法。然而,利用频谱图与时域输入的互补信息进行 MSS 的研究尚显不足。本文提出一种 CatNet 框架,其将使用频谱图作为输入的 UNet 分离分支与使用时域波形作为输入的 WavUNet 分离分支拼接用于 MSS。我们提出了一种端到端且完全可微的系统,将频谱图计算嵌入 CatNet 中。此外,我们提出一种新颖的混合音频数据增强方法,从同一声源中随机混合音频片段作为增强音频片段用于训练。我们提出的 CatNet MSS 系统在 MUSDB18 数据集上取得了 7.54 dB 的人声分离源失真比(SDR)这一当前最优(SOTA)结果,优于 MMDenseNet 的 6.57 dB。

关键词

引用

@article{arxiv.2102.09966,
  title  = {CatNet: music source separation system with mix-audio augmentation},
  author = {Xuchen Song and Qiuqiang Kong and Xingjian Du and Yuxuan Wang},
  journal= {arXiv preprint arXiv:2102.09966},
  year   = {2021}
}

备注

5 pages