中文

CultureMERT:面向跨文化音乐表示学习的持续预训练

声音 2025-06-24 v1 人工智能 机器学习 音频与语音处理

摘要

音乐基础模型的最新进展改进了音频表示学习,但其在 diverse 音乐传统上的有效性仍然有限。我们引入了 CultureMERT-95M,这是一个经过多文化适配的基础模型,旨在增强跨文化音乐表示学习与理解。为此,我们提出了一种两阶段持续预训练策略,该策略集成了学习率重升温与重衰减,即使在计算资源有限的情况下也能实现稳定适配。在包含希腊、土耳其和印度音乐传统的 650 小时多文化数据混合上进行训练,使得在 diverse 非西方音乐自动标注任务上的 ROC-AUC 和 AP 平均提升了 4.9%,超越了先前最先进水平,且在以西方为中心的基准测试上遗忘极小。我们进一步研究了任务算术,这是一种多文化适配的替代方法,它在权重空间中合并单文化适配模型。任务算术在非西方自动标注任务上的表现与我们经过多文化训练的模型相当,并且在西方数据集上没有表现出退化。跨文化评估表明,单文化模型在不同音乐传统之间的迁移效果各异,而多文化适配模型实现了最佳的整体性能。为了支持世界音乐表示学习的研究,我们公开发布了 CultureMERT-95M 和 CultureMERT-TA-95M,促进更具文化意识的音乐基础模型的发展。

关键词

引用

@article{arxiv.2506.17818,
  title  = {CultureMERT: Continual Pre-Training for Cross-Cultural Music Representation Learning},
  author = {Angelos-Nikolaos Kanatas and Charilaos Papaioannou and Alexandros Potamianos},
  journal= {arXiv preprint arXiv:2506.17818},
  year   = {2025}
}

备注

10 pages, 4 figures, accepted to the 26th International Society for Music Information Retrieval conference (ISMIR 2025), to be held in Daejeon, South Korea