中文

基础音频编码器是否理解音乐结构?

声音 2026-01-30 v2 机器学习 音频与语音处理

摘要

在音乐信息检索 (MIR) 研究中,近期变得流行的是使用预训练的基础音频编码器 (FAEs)。在大量音乐和音频数据上预训练的 FAEs 已被证明可提高 MIR 任务(如音乐标记和自动音乐转写)的性能。然而,FAEs 在音乐结构分析 (MSA) 方面的应用尚未得到广泛探索:只有小部分 FAEs 被用于 MSA,且学习方法、训练数据以及模型上下文长度对 MSA 性能的影响尚不清晰。本研究对 11 种 FAEs 进行全面实验,探讨这些因素对 MSA 性能的影响。我们的结果表明,使用基于音乐数据的自监督学习和遮盖语言建模的 FAEs 在 MSA 上尤其有效。我们的发现为 FAE 与 MSA 之间的未来研究指明了方向。

关键词

引用

@article{arxiv.2512.17209,
  title  = {Do Foundational Audio Encoders Understand Music Structure?},
  author = {Keisuke Toyama and Zhi Zhong and Akira Takahashi and Shusuke Takahashi and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2512.17209},
  year   = {2026}
}

备注

Accepted to ICASSP 2026