半监督音乐标注 Transformer
声音
2021-11-29 v1 音频与语音处理
摘要
我们提出了采用半监督方法训练的 Music Tagging Transformer。所提出的模型在浅层卷积层中捕获局部声学特征,然后使用堆叠的自注意力层对提取的特征序列进行时间上的总结。通过仔细的模型评估,我们首先表明,在监督方案下,所提出的架构优于先前基于卷积神经网络的最先进音乐标注模型。Music Tagging Transformer 通过 noisy student training 得到进一步提升,这是一种半监督方法,利用标记和未标记数据并结合数据增强。据我们所知,这是首次尝试利用百万歌曲数据集的全部音频。
引用
@article{arxiv.2111.13457,
title = {Semi-Supervised Music Tagging Transformer},
author = {Minz Won and Keunwoo Choi and Xavier Serra},
journal= {arXiv preprint arXiv:2111.13457},
year = {2021}
}
备注
International Society for Music Information Retrieval (ISMIR) 2021