中文

语音自监督学习在音乐上的有效性研究

声音 2023-07-12 v1 人工智能 机器学习 音频与语音处理

摘要

自监督学习(SSL)在各种语音和自然语言处理应用中已展现出有前景的结果。然而,其在音乐信息检索(MIR)中的功效在很大程度上仍未被探索。尽管先前在音乐录音上预训练的SSL模型大多可能是闭源的,但近期的语音模型如wav2vec2.0已在音乐建模中显示出潜力。尽管如此,探索将语音SSL模型应用于音乐录音的有效性的研究仍然有限。我们利用两种独特的语音相关模型data2vec1.0和Hubert探索SSL的音乐适配,并分别称其为music2vec和musicHuBERT。我们在多种预训练配置下训练了具有9500万(95M)参数的12个SSL模型,并使用13种不同的MIR任务系统性地评估MIR任务性能。我们的发现表明,即便使用为语音设计的范式进行训练,使用音乐数据训练通常能提升MIR任务上的性能。然而,我们指出了此类现有语音导向设计的局限性,尤其在建模复调信息方面。基于实验结果,我们也给出了设计未来音乐SSL策略和范式的经验性建议。

关键词

引用

@article{arxiv.2307.05161,
  title  = {On the Effectiveness of Speech Self-supervised Learning for Music},
  author = {Yinghao Ma and Ruibin Yuan and Yizhi Li and Ge Zhang and Xingran Chen and Hanzhi Yin and Chenghua Lin and Emmanouil Benetos and Anton Ragni and Norbert Gyenge and Ruibo Liu and Gus Xia and Roger Dannenberg and Yike Guo and Jie Fu},
  journal= {arXiv preprint arXiv:2307.05161},
  year   = {2023}
}