面向音乐表示学习的音频 Transformer 高效监督训练
声音
2023-09-29 v1 音频与语音处理
摘要
在本工作中,我们针对音乐表示学习使用无卷积的 transformers。我们在基于谱图的现有音频 transformers(如 AST)基础上,使用类似于 PaSST 的 patchout 训练在监督任务上训练我们的模型。与以往工作不同,我们研究特定设计决策如何影响下游音乐标注任务,而非聚焦于训练任务本身。我们评估了以下因素的影响:使用不同预训练权重初始化模型、使用不同输入音频片段长度、为下游任务使用 transformer 不同块与 token 的学习表示,以及在推理时应用 patchout 以加速特征提取。我们发现:1) 从 ImageNet 或 AudioSet 权重初始化模型并使用更长输入片段对训练与下游任务均有益;2) 所考虑下游任务的最佳表示位于 transformer 的中间块;3) 推理时使用 patchout 比我们的卷积基线处理更快,同时保持更优性能。所得模型 MAEST 已公开可用,并在音乐标注任务中于开放模型中取得最佳性能。
引用
@article{arxiv.2309.16418,
title = {Efficient Supervised Training of Audio Transformers for Music Representation Learning},
author = {Pablo Alonso-Jiménez and Xavier Serra and Dmitry Bogdanov},
journal= {arXiv preprint arXiv:2309.16418},
year = {2023}
}
备注
Accepted at the 2023 International Society for Music Information Retrieval Conference (ISMIR'23)