中文

联合检测与分离歌声:一种多任务方法

声音 2018-04-06 v1 机器学习 音频与语音处理

摘要

将深度学习应用于音乐处理的一大挑战是训练数据的可用性。一种潜在的解决方案是多任务学习(Multi-task Learning),即模型还在额外数据集上学习解决相关的辅助任务,以利用它们之间的相关性。尽管原理上直观,但识别相关任务并构建模型以在任务间最优地共享信息可能具有挑战性。本文中,我们将人声活动检测作为附加任务,以稳定并提升人声分离的性能。此外,我们识别出各数据集特有的、可能限制分离与检测模型泛化能力的问题偏差,而我们提出的方法对此具有鲁棒性。实验表明,相较于单任务基线,分离与人声检测性能均有所提升。然而,我们发现常用的信号失真比(Signal-to-Distortion Ratio, SDR)指标未能捕捉到在非人声段落上的改进,表明需要改进评估方法。

关键词

引用

@article{arxiv.1804.01650,
  title  = {Jointly Detecting and Separating Singing Voice: A Multi-Task Approach},
  author = {Daniel Stoller and Sebastian Ewert and Simon Dixon},
  journal= {arXiv preprint arXiv:1804.01650},
  year   = {2018}
}

备注

10 pages, 2 figures, accepted for the 14th International Conference on Latent Variable Analysis and Signal Separation