中文

S-KEY:从音频中自监督学习大调与小调

声音 2025-06-24 v2 音频与语音处理

摘要

STONE 是目前用于音乐信号调性估计的自监督学习方法,它无法区分关系调,例如 C 大调与 A 小调。在本文中,我们扩展了 STONE 的神经网络架构和学习目标,以执行大调和小调的自监督学习 (S-KEY)。我们的主要贡献是针对 STONE 的辅助前置任务,该任务使用转置不变的色度特征作为伪标签源进行构建。S-KEY 在 FMAKv2 和 GTZAN 数据集上的调性估计中达到了有监督的最先进水平,同时不需要人工标注,且具有与 STONE 相同的参数预算。我们基于这一结果,将 S-KEY 的训练集扩展到一百万首歌曲,从而展示了大规模自监督学习在音乐信息检索中的潜力。

关键词

引用

@article{arxiv.2501.12907,
  title  = {S-KEY: Self-supervised Learning of Major and Minor Keys from Audio},
  author = {Yuexuan Kong and Gabriel Meseguer-Brocal and Vincent Lostanlen and Mathieu Lagrange and Romain Hennequin},
  journal= {arXiv preprint arXiv:2501.12907},
  year   = {2025}
}