中文

解释用于音乐分类的深度卷积神经网络

机器学习 2016-07-11 v1 人工智能 多媒体 声音

摘要

深度卷积神经网络 (CNNs) 已积极应用于音乐信息检索领域,例如流派分类、情绪检测和和弦识别。然而其学习和预测过程鲜为人知,特别是当应用于频谱图时。我们引入 CNN 的可听化 (auralisation) 以理解其底层机制,该方法基于 [2] 中引入的反卷积过程。CNN 的可听化是将从反卷积获得的已学习卷积特征转换为音频信号。在实验与讨论中,我们基于反卷积频谱图和可听化信号解释了 5 层 CNN 的训练特征。我们还研究了每层随不同音乐属性变化的成对相关性,以理解所学特征的演化。结果表明,在深层中,所学特征用于捕捉纹理,即连续分布的模式,而非线条的形状。

关键词

引用

@article{arxiv.1607.02444,
  title  = {Explaining Deep Convolutional Neural Networks on Music Classification},
  author = {Keunwoo Choi and George Fazekas and Mark Sandler},
  journal= {arXiv preprint arXiv:1607.02444},
  year   = {2016}
}

备注

7 pages, 10 figures