中文

大规模自监督音乐表示模型的层级分析

声音 2025-05-23 v1 人工智能 音频与语音处理

摘要

最近,基于自监督学习(SSL)的音乐信息检索预训练模型正变得流行,已在 various downstream任务中取得成功。然而,关于编码信息的具体含义及其适用性的研究仍有限。探索这些方面有助于更好地理解这些模型的能力与局限,进而更有效地应用于下游任务。在本研究中,我们分析了先进的音乐表示模型 MusicFM 和新兴的 SSL 模型 MuQ。我们聚焦于三个主要方面:(i)验证 SSL 模型在多个下游任务中的优势,(ii)探索层级信息对不同任务的专化性,(iii)比较选择特定层时的性能差异。通过这一分析,我们揭示了 SSL 模型在音乐信息检索中的结构性洞见及潜在应用。

关键词

引用

@article{arxiv.2505.16306,
  title  = {Layer-wise Investigation of Large-Scale Self-Supervised Music Representation Models},
  author = {Yizhi Zhou and Haina Zhu and Hangting Chen},
  journal= {arXiv preprint arXiv:2505.16306},
  year   = {2025}
}