中文

使用预训练卷积神经网络进行多层级多尺度特征聚合的音乐自动标注

神经与进化计算 2017-08-02 v2 机器学习 多媒体 声音

摘要

音乐自动标注通常以类似于图像分类的方式处理,将二维音频频谱图视为图像数据。然而,音乐自动标注与图像分类的区别在于标签高度多样化且具有不同的抽象层次。考虑到这一问题,我们提出了一种基于卷积神经网络(CNN)的架构,该架构融合了多层级和多尺度特征。该架构分三步训练。首先,我们进行有监督特征学习,使用一组具有不同输入尺寸的CNN来捕获局部音频特征。其次,我们分别从预训练卷积网络的每一层提取音频特征,并在给定长音频片段的情况下将它们聚合在一起。最后,我们将它们输入全连接网络并对标签进行最终预测。我们的实验表明,使用多层级和多尺度特征的组合在音乐自动标注中非常有效,并且所提出的方法在MagnaTagATune数据集和Million Song数据集上优于先前的最先进技术。我们进一步表明,所提出的架构在迁移学习中很有用。

关键词

引用

@article{arxiv.1703.01793,
  title  = {Multi-Level and Multi-Scale Feature Aggregation Using Pre-trained Convolutional Neural Networks for Music Auto-tagging},
  author = {Jongpil Lee and Juhan Nam},
  journal= {arXiv preprint arXiv:1703.01793},
  year   = {2017}
}

备注

5 pages, 5 figures, 2 tables