中文

基于频带分割 RNN 的音乐源分离

音频与语音处理 2022-10-03 v1 机器学习 声音 信号处理

摘要

近年来,得益于新颖神经网络架构与训练流程的发展,音乐源分离(MSS)模型的性能得到了极大提升。然而,近期面向 MSS 的模型设计主要受到其他音频处理任务或其他研究领域的启发,音乐信号的内在特性与规律尚未被充分发掘。本文提出频带分割 RNN(BSRNN),一种频域模型,其显式地将混合信号的谱图分割为子带,并进行交错式的带级与序列级建模。子带带宽的选择可由关于目标源特性的先验知识或专家知识确定,以优化针对某类目标乐器的性能。为更好地利用无标签数据,我们还描述了一种半监督模型微调流程,可进一步提升模型性能。实验结果表明,仅在 MUSDB18-HQ 数据集上训练的 BSRNN 显著优于 Music Demixing(MDX)Challenge 2021 中多个排名靠前的模型,且半监督微调阶段进一步改善了全部四条乐器音轨上的性能。

关键词

引用

@article{arxiv.2209.15174,
  title  = {Music Source Separation with Band-split RNN},
  author = {Yi Luo and Jianwei Yu},
  journal= {arXiv preprint arXiv:2209.15174},
  year   = {2022}
}