中文

掩码对比预训练提升音乐音频音阶检测

声音 2026-04-14 v1 机器学习

摘要

自监督音乐基础模型在音阶检测方面表现不佳,这一任务需要音调敏感的表征。本文首次系统性研究表明,自监督预训练的设计直接影响音调灵敏性,并证明掩码对比嵌入在监督环境下实现音阶检测的SOTA性能。首先,我们发现对Mel频谱图进行基于掩码的对比预训练后的线性评估在音阶检测方面开箱即用地表现具竞争力。这引导我们在来自基模型提取的特征上训练浅而宽的多层感知器(MLP),在无需复杂数据增强策略的情况下实现SOTA性能。我们进一步分析了鲁棒性,并经验性地表明所学表征天然编码了常见的数据增强。我们的研究确立了自监督预训练作为面向音调敏感的音乐信息检索任务的有效方法,并为设计和探针音乐基础模型提供了洞见。

关键词

引用

@article{arxiv.2604.10021,
  title  = {Masked Contrastive Pre-Training Improves Music Audio Key Detection},
  author = {Ori Yonay and Tracy Hammond and Tianbao Yang},
  journal= {arXiv preprint arXiv:2604.10021},
  year   = {2026}
}

备注

Code and models available at github.com/echo-cipher/keymyna