基于CNN的自动音乐标注模型评估
音频与语音处理
2020-06-02 v1 声音
摘要
深度学习的近期进展加速了基于内容的自动音乐标注系统的发展。音乐信息检索(MIR)研究者提出了多种主要基于卷积神经网络(CNNs)的架构设计,在该多标签二分类任务中取得了最先进的结果。然而,由于研究者所遵循的实验设置存在差异,例如使用不同的数据集划分和评估软件版本,难以直接相互比较所提架构。为促进进一步研究,本文我们在三个数据集(MagnaTagATune、Million Song Dataset和MTG-Jamendo)上对不同音乐标注模型进行了一致性评估,并使用通用评估指标(ROC-AUC和PR-AUC)提供参考结果。此外,所有模型均使用扰动输入进行评估,以考察其在时间拉伸、音高偏移、动态范围压缩和加入白噪声方面的泛化能力。为可复现,我们提供了带有预训练模型的PyTorch实现。
引用
@article{arxiv.2006.00751,
title = {Evaluation of CNN-based Automatic Music Tagging Models},
author = {Minz Won and Andres Ferraro and Dmitry Bogdanov and Xavier Serra},
journal= {arXiv preprint arXiv:2006.00751},
year = {2020}
}
备注
7 pages, 2 figures, Sound and Music Computing 2020 (SMC 2020)