中文

应用于音乐的卷积神经网络基本滤波器:训练还是设计?

机器学习 2018-09-20 v3 信息检索

摘要

当卷积神经网络用于解决基于音乐或更一般地时间序列数据的学习问题时,原始一维数据通常被预处理以获得谱图或梅尔谱图系数,然后用作实际神经网络的输入。在本工作中,我们从理论和实验两方面研究了该预处理步骤对网络性能的影响,并提出问题:是否可通过将自适应或学习的滤波器直接应用于原始数据来替代它,从而改善学习成效。理论结果表明,通过应用自适应滤波器及随后的时间平均来近似重现梅尔谱图系数在原则上是可能的。我们还在音乐中歌声检测任务上进行了广泛的实验工作。这些实验结果表明,对于基于卷积神经网络的分类,由自适应滤波器组随后时间平均得到的特征优于基于傅里叶变换的经典梅尔谱图系数。从训练数据学习中心频率或时间平均长度的替代自适应方法表现同样良好。

关键词

引用

@article{arxiv.1709.02291,
  title  = {Basic Filters for Convolutional Neural Networks Applied to Music: Training or Design?},
  author = {Monika Doerfler and Thomas Grill and Roswitha Bammer and Arthur Flexer},
  journal= {arXiv preprint arXiv:1709.02291},
  year   = {2018}
}

备注

Completely revised version; 21 pages, 4 figures