中文

基于卷积循环神经网络的音乐艺术家分类

声音 2019-03-18 v2 机器学习 多媒体 音频与语音处理 机器学习

摘要

先前音乐艺术家分类的尝试使用帧级音频特征,这些特征总结了短时间区间内的频率内容。相较而言,近期的音乐信息检索任务利用深度卷积与循环模型来利用音频频谱图中的时间结构。本文以这一新框架重新审视艺术家分类,并实证探究了在特征表示中引入时间结构的影响。为此,一个成熟的分类架构——卷积循环神经网络(CRNN)——在 comprehensive 条件下应用于 artist20 音乐艺术家识别数据集。这些条件包括音频片段长度(这是本工作的新颖贡献)以及先前已确认的因素如数据集划分与特征层级。我们的结果优于基线工作,验证了制作人效应对分类性能的影响,并展示了音频长度与训练集规模之间的权衡。性能最佳的模型在三次独立试验中取得了平均 F1 分数 0.937,相较于相似条件下相应基线有显著提升。此外,为展示 CRNN 特征提取能力的有效性,我们在模型瓶颈层对音频样本进行可视化,表明所学表示聚类为属于各自艺术家的簇。

关键词

引用

@article{arxiv.1901.04555,
  title  = {Music Artist Classification with Convolutional Recurrent Neural Networks},
  author = {Zain Nasrullah and Yue Zhao},
  journal= {arXiv preprint arXiv:1901.04555},
  year   = {2019}
}

备注

Proceedings of the 2019 International Joint Conference on Neural Networks (IJCNN)