中文

通过音乐源分离预训练音乐分类模型

音频与语音处理 2024-04-24 v3

摘要

本文研究音乐源分离是否可用作面向音乐分类任务的音乐表示学习的预训练策略。为此,我们首先在各种音乐源分离目标下预训练 U-Net 网络,例如从乐曲中分离人声或器乐源;之后,我们在预训练的 U-Net 上连接一个分类网络并联合微调整个网络。分离网络学到的特征也通过卷积特征适配模块传播到后端网络。在两个广泛使用且公开可用的数据集上的实验结果表明,与从头训练整个网络以及将后端网络作为独立模型用于两个音乐分类任务(音乐自动标注和音乐流派分类)相比,以音乐源分离目标预训练 U-Net 可提升性能。我们还表明,我们提出的框架可成功集成到基于卷积和基于 Transformer 的后端中,凸显其模块化特性。

关键词

引用

@article{arxiv.2310.15845,
  title  = {Pre-training Music Classification Models via Music Source Separation},
  author = {Christos Garoufis and Athanasia Zlatintsi and Petros Maragos},
  journal= {arXiv preprint arXiv:2310.15845},
  year   = {2024}
}

备注

5 pages, 2 figures/2 tables. EUSIPCO-24 submission (changes from v1: experiments with AST - classification backbone pre-training - correct FMA subset)