中文

通用音乐表征?在世界音乐语料库上评估基础模型

声音 2025-06-23 v1 信息检索 机器学习 音频与语音处理

摘要

基础模型在音乐信息检索领域取得了突破性进展,但它们是否能在多样化的音乐传统之间普遍化仍是未知数。本文对五个最先进的音频基础模型在六个音乐语料库上的表现进行全面评估,这些语料库涵盖西方流行音乐、希腊音乐、土耳其音乐和印度古典音乐等不同传统。我们采用三种互补的方法来探讨这些模型的跨文化能力:通过探测技术评估其内在表征,针对性地对1-2层进行监督式微调,以应对资源有限的场景,以及进行多标签零样本学习。我们的分析显示,跨文化泛化能力各不相同,较大的模型通常在非西方音乐上表现更好,但对于文化距离较远的传统效果会下降。值得注意的是,我们的方法在五个六个评估数据集上实现了最先进的性能,证明了基础模型在世界音乐理解方面的有效性。我们还发现,针对性微调方法并不一定在所有情境下都优于探测,这表明基础模型已经编码了相当大的音乐知识。我们的评估框架和基准测试结果有助于理解当前模型距离实现通用音乐表征有多远,并为未来进展建立指标。

关键词

引用

@article{arxiv.2506.17055,
  title  = {Universal Music Representations? Evaluating Foundation Models on World Music Corpora},
  author = {Charilaos Papaioannou and Emmanouil Benetos and Alexandros Potamianos},
  journal= {arXiv preprint arXiv:2506.17055},
  year   = {2025}
}

备注

Accepted at ISMIR 2025