中文

基于深度平衡模型的音乐源分离

声音 2022-04-29 v2 音频与语音处理

摘要

尽管基于深度神经网络的音乐源分离(MSS)非常有效且性能很高,但其模型规模常常成为实际部署中的问题。深度隐式架构如深度平衡模型(DEQ)近期被提出,其能在深度有限的情况下以较少的参数数量取得比显式对应模型更高的性能。这使得 DEQ 对 MSS 也具有吸引力,尤其是它最初应用于自然语言处理中的序列建模任务,因此原则上也应适用于 MSS。然而,由于声学信号的特征不同于自然语言数据,需要研究适用于 DEQ 的 MSS 的良好架构与训练方案。因此,本文提出一种用于 MSS 的 DEQ 架构与训练方案。从 Open-Unmix(UMX)的架构出发,将其序列模型替换为 DEQ。我们将所提方法称为基于 DEQ 的 UMX(DEQ-UMX)。实验结果表明,DEQ-UMX 性能优于原始 UMX,同时将其参数数量减少了 30%。

关键词

引用

@article{arxiv.2110.06494,
  title  = {Music Source Separation with Deep Equilibrium Models},
  author = {Yuichiro Koyama and Naoki Murata and Stefan Uhlich and Giorgio Fabbro and Shusuke Takahashi and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2110.06494},
  year   = {2022}
}

备注

5 pages, 4 figures, accepted for publication in IEEE ICASSP 2022