中文

通道式子带输入用于高分辨率音乐中更优的人声与伴奏分离

音频与语音处理 2023-10-10 v2 声音

摘要

本文提出一种新的输入格式——通道式子带输入(CWS),用于基于卷积神经网络(CNN)的频域音乐源分离(MSS)模型。我们旨在解决基于 CNN 的高分辨率 MSS 模型中的主要问题:高计算成本以及截然不同频带间的权重共享。具体而言,本文将混合信号谱分解为若干频带,并按通道拼接作为模型输入。所提方法在每个子带内实现了有效的权重共享,并引入了通道间更大的灵活性。为比较起见,我们在不同规模、架构和 CWS 设置的模型上进行了人声与伴奏分离(VAS)。实验表明 CWS 输入在多方面有益。我们在 musdb18hq 测试集上评估了我们的方法,重点关注 SDR、SIR 和 SAR 指标。在所有实验中,CWS 使模型在平均指标上获得 6.9% 的性能提升。即便参数更少、训练数据更少且训练时间更短,我们具有 8 频带 CWS 输入的 MDenseNet 仍以较大优势超越原始 MMDenseNet。此外,CWS 还大幅降低了计算成本和训练时间。

关键词

引用

@article{arxiv.2008.05216,
  title  = {Channel-wise Subband Input for Better Voice and Accompaniment Separation on High Resolution Music},
  author = {Haohe Liu and Lei Xie and Jian Wu and Geng Yang},
  journal= {arXiv preprint arXiv:2008.05216},
  year   = {2023}
}

备注

Accepted in INTERSPEECH 2020