中文

STONE:自监督调性估计器

声音 2025-04-02 v4 音频与语音处理

摘要

尽管深度神经网络能够估计音乐片段的调性,但其监督学习需要大量的标注工作。针对这一缺陷,我们提出了首个自监督调性估计器 STONE。STONE 背后的架构名为 ChromaNet,是一个具有八度等价性的卷积网络,可输出包含 12 个结构化 logits 的调号特征谱(KSP)。首先,我们训练 ChromaNet 对同一音频轨道中任意两个未标注音乐片段之间的人工音高移调进行回归,该移调通过五度圈内的互功率谱密度(CPSD)来度量。我们观察到,这一自监督前置任务使得 KSP 与调号产生相关性。基于这一观察,我们将 STONE 扩展为输出包含 24 个 logits 的结构化 KSP,并引入监督以区分共享同一调号的大调与小调。施加不同程度的监督可得到半监督和全监督调性估计器,即 Semi-TONEs 和 Sup-TONEs。我们在 FMAK 上评估了这些估计器,这是一个包含 5489 段真实世界音乐录音并由专家标注了 24 个大调和小调的新数据集。我们发现,Semi-TONE 在减少监督的情况下达到了与 Sup-TONE 相同的分类准确率,而在同等监督下则优于 Sup-TONE。

关键词

引用

@article{arxiv.2407.07408,
  title  = {STONE: Self-supervised Tonality Estimator},
  author = {Yuexuan Kong and Vincent Lostanlen and Gabriel Meseguer-Brocal and Stella Wong and Mathieu Lagrange and Romain Hennequin},
  journal= {arXiv preprint arXiv:2407.07408},
  year   = {2025}
}