中文

半监督音乐标注 Transformer

声音 2021-11-29 v1 音频与语音处理

摘要

我们提出了采用半监督方法训练的 Music Tagging Transformer。所提出的模型在浅层卷积层中捕获局部声学特征,然后使用堆叠的自注意力层对提取的特征序列进行时间上的总结。通过仔细的模型评估,我们首先表明,在监督方案下,所提出的架构优于先前基于卷积神经网络的最先进音乐标注模型。Music Tagging Transformer 通过 noisy student training 得到进一步提升,这是一种半监督方法,利用标记和未标记数据并结合数据增强。据我们所知,这是首次尝试利用百万歌曲数据集的全部音频。

关键词

引用

@article{arxiv.2111.13457,
  title  = {Semi-Supervised Music Tagging Transformer},
  author = {Minz Won and Keunwoo Choi and Xavier Serra},
  journal= {arXiv preprint arXiv:2111.13457},
  year   = {2021}
}

备注

International Society for Music Information Retrieval (ISMIR) 2021