中文

面向鲁棒音频—乐谱检索系统的自监督对比学习

声音 2023-09-22 v1 信息检索 机器学习 音频与语音处理

摘要

将乐谱图像与音频录音相关联仍是构建高效跨模态音乐检索系统的关键问题。解决该任务的基本方法之一是通过深度神经网络学习一个能够连接短时段音频与乐谱的跨模态嵌入空间。然而,来自真实音乐内容的标注数据稀缺,影响了此类方法在真实检索场景中的泛化能力。在本工作中,我们研究是否可以通过自监督对比学习来缓解这一限制:将网络暴露于大量真实音乐数据作为预训练步骤,通过对两种模态(即音频与乐谱图像)的随机增强片段视图进行对比。通过在合成与真实钢琴数据上的一系列实验,我们表明预训练模型在所有场景与预训练配置下均能更精确地检索片段。受这些结果鼓舞,我们将片段嵌入用于跨模态乐曲识别这一更高层次任务,并在多种检索配置下进行了更多实验。在该任务中,我们观察到当存在真实音乐数据时,检索质量从30%提升至最高100%。我们最后论证了自监督对比学习在缓解多模态音乐检索模型中标注数据稀缺方面的潜力。

关键词

引用

@article{arxiv.2309.12134,
  title  = {Self-Supervised Contrastive Learning for Robust Audio-Sheet Music Retrieval Systems},
  author = {Luis Carvalho and Tobias Washüttl and Gerhard Widmer},
  journal= {arXiv preprint arXiv:2309.12134},
  year   = {2023}
}