解释用于音乐分类的深度卷积神经网络
机器学习
2016-07-11 v1 人工智能
多媒体
声音
摘要
深度卷积神经网络 (CNNs) 已积极应用于音乐信息检索领域,例如流派分类、情绪检测和和弦识别。然而其学习和预测过程鲜为人知,特别是当应用于频谱图时。我们引入 CNN 的可听化 (auralisation) 以理解其底层机制,该方法基于 [2] 中引入的反卷积过程。CNN 的可听化是将从反卷积获得的已学习卷积特征转换为音频信号。在实验与讨论中,我们基于反卷积频谱图和可听化信号解释了 5 层 CNN 的训练特征。我们还研究了每层随不同音乐属性变化的成对相关性,以理解所学特征的演化。结果表明,在深层中,所学特征用于捕捉纹理,即连续分布的模式,而非线条的形状。
引用
@article{arxiv.1607.02444,
title = {Explaining Deep Convolutional Neural Networks on Music Classification},
author = {Keunwoo Choi and George Fazekas and Mark Sandler},
journal= {arXiv preprint arXiv:1607.02444},
year = {2016}
}
备注
7 pages, 10 figures