中文

面向哼唱检索任务数据集收集的半监督深度学习方法

声音 2023-12-05 v1 机器学习 音频与语音处理

摘要

哼唱检索(Query-by-Humming, QbH)是一项根据哼唱或演唱片段寻找最相关歌曲的任务。尽管近期已有成功的商业解决方案,但由于缺乏用于训练机器学习模型的高质量数据集,QbH系统的实现仍具挑战性。本文提出一种深度学习数据收集技术,并介绍了对齐翻唱与哼唱数据集(Covers and Hummings Aligned Dataset, CHAD),这是一个包含18小时短音乐片段并配有时间对齐哼唱版本的新型数据集。为扩充我们的数据集,我们采用半监督模型训练流程,将QbH任务作为翻唱歌曲识别(cover song identification, CSI)任务的一个特例。从在初始数据集上训练的模型开始,我们迭代收集同一首歌曲翻唱版本的片段组,并在扩充后的数据上重新训练模型。利用该流程,我们收集了超过308小时的额外音乐片段,并配有时间对齐的翻唱版本。最终模型成功应用于QbH任务,并在基准数据集上取得了具有竞争力的结果。我们的研究表明,所提出的数据集和训练流程能够有效促进QbH系统的实现。

关键词

引用

@article{arxiv.2312.01092,
  title  = {A Semi-Supervised Deep Learning Approach to Dataset Collection for Query-By-Humming Task},
  author = {Amantur Amatov and Dmitry Lamanov and Maksim Titov and Ivan Vovk and Ilya Makarov and Mikhail Kudinov},
  journal= {arXiv preprint arXiv:2312.01092},
  year   = {2023}
}