中文

SLAP:用于音乐理解的无负样本孪生语言-音频预训练

声音 2025-06-24 v1 音频与语音处理

摘要

联合嵌入空间通过多模态对比学习将文本与音频联系起来,显著推进了音乐理解与生成。然而,这些方法由于依赖大批量大小来有效利用负样本,面临着巨大的内存需求限制。此外,多模态联合嵌入空间存在模态鸿沟问题,即来自不同模态的嵌入位于嵌入空间的不同流形中。为了应对这些挑战,我们提出了孪生语言-音频预训练(SLAP),这是一种新颖的多模态预训练框架,无需负样本即可学习强大的表示。SLAP 将 Bootstrap Your Own Latent (BYOL) 范式适配于多模态音频-文本训练,促进了多模态嵌入空间训练的可扩展性。我们展示了模型学习音乐与文本之间有意义关系的能力——具体而言,我们表明 SLAP 在文本-音乐检索和零样本分类等任务上优于 CLAP。我们还观察到在包括更大规模或监督模型在内的多个 MIR 任务(流派和乐器分类、自动标注)上具有竞争力的下游性能。此外,我们的方法具有吸引人的特性,例如可量化的模态鸿沟缩减,以及对检索性能在批量大小变化下的鲁棒性提升。最后,其新颖的公式化通过梯度累积解锁了在单 GPU 上的大规模训练。

关键词

引用

@article{arxiv.2506.17815,
  title  = {SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding},
  author = {Julien Guinot and Alain Riou and Elio Quinton and György Fazekas},
  journal= {arXiv preprint arXiv:2506.17815},
  year   = {2025}
}

备注

Accepted to ISMIR 2025