中文

S3T:基于Swin Transformer自监督预训练的音乐分类方法

音频与语音处理 2022-02-22 v1 信息检索 声音

摘要

本文中,我们提出S3T,一种基于Swin Transformer的自监督预训练方法用于音乐分类,旨在从海量易获取的无标签音乐数据中学习有意义的音乐表征。S3T引入基于动量的范式MoCo,以Swin Transformer作为其音乐时频域的特征提取器。为更好地学习音乐表征,S3T贡献了一条音乐数据增强流水线以及两个专门设计的预处理器。据我们所知,S3T是首个将Swin Transformer与自监督学习方法结合用于音乐分类的方法。我们在音乐流派分类与音乐标注任务上评估S3T,使用在所学表征上训练的线性分类器。实验结果表明,S3T在两个任务上分别以12.5%的top-1准确率和4.8%的PR-AUC超越先前自监督方法(CLMR),并且也超过了任务特定的最先进(SOTA)监督方法。此外,S3T在仅使用10%标签数据时展现出标签效率优势,在两个任务上均超越使用100%标签数据的CLMR。

关键词

引用

@article{arxiv.2202.10139,
  title  = {S3T: Self-Supervised Pre-training with Swin Transformer for Music Classification},
  author = {Hang Zhao and Chen Zhang and Belei Zhu and Zejun Ma and Kejun Zhang},
  journal= {arXiv preprint arXiv:2202.10139},
  year   = {2022}
}

备注

Accepted by ICASSP2022