中文

基于师生模型的半监督学习用于人声旋律提取

音频与语音处理 2020-08-17 v1 声音

摘要

标注数据的缺乏是许多音乐信息检索任务(如旋律提取)中的主要障碍,其中标注极其费力或昂贵。半监督学习(SSL)通过利用大量未标注数据提供了缓解该问题的方案。本文中,我们提出一种使用师生模型进行人声旋律提取的SSL方法。教师模型以标注数据预训练,并在自训练设置下引导学生在给定未标注输入时做出相同预测。我们考察了具有不同数据增强方案与损失函数的三种师生模型设置。此外,考虑到测试阶段标注数据的稀缺,我们使用分析-合成方法从未标注数据人工生成带有音高标注的大规模测试数据。结果表明,相较于仅监督学习,SSL方法显著提升性能,且改进依赖于师生模型、未标注数据规模、自训练迭代次数及其他训练细节。我们还发现,确保未标注音频包含人声部分至关重要。最后,我们展示所提SSL方法使一个基线卷积循环神经网络模型取得可与最先进水平(state-of-the-art)相媲美的性能。

关键词

引用

@article{arxiv.2008.06358,
  title  = {Semi-supervised learning using teacher-student models for vocal melody extraction},
  author = {Sangeun Kum and Jing-Hua Lin and Li Su and Juhan Nam},
  journal= {arXiv preprint arXiv:2008.06358},
  year   = {2020}
}

备注

8 pages, 5 figures, accepted for the 21st International Society for Music Information Retrieval Conference (ISMIR 2020)