中文

STONE:自监督音调估计器

数论 2025-04-15 v3

摘要

尽管深度神经网络能够估计音乐作品的调性,但其监督训练需要大量的标注工作。针对这一不足,本文提出了 STONE,即首个自监督音调估计器。STONE 背后的架构称为 ChromaNet,这是一个具备八度等价性的卷积神经网络,其输出为 12 个结构化 logits 的调性签名轮廓 (KSP)。首先,我们训练 ChromaNet 来回归任意两个未标记音乐片段之间的人工音高转位,其内在度量为圆 fifths (CoF) 中的 cross-power spectral density (CPSD)。我们观察到,这一自监督预文本任务导致 KSP 与调性调子相关。基于此观察,我们扩展 STONE 以输出 24 个结构化 KSP 的 logits,并引入监督以消除共享相同调性签名的大调与小调之间的歧义。应用不同amounts的监督,可得到半监督与完全监督的音调估计器,即 Semi-TONEs 和 Sup-TONEs。我们在 FMAK 数据集上对这些估计器进行评估,该数据集包含 5489 份真实音乐录音,并附有 24 种大调和小调的专家标注。我们发现,Semi-TONE 在相同监督条件下匹配 Sup-TONE 的分类准确率,而在相同监督条件下则优于 Sup-TONE。

关键词

引用

@article{arxiv.2407.07407,
  title  = {General sharp bounds for the number of solutions to purely exponential equations with three terms},
  author = {Maohua Le and Takafumi Miyazaki},
  journal= {arXiv preprint arXiv:2407.07407},
  year   = {2025}
}

备注

25 pages; title changed; major revision