卷积神经网络中残差块设计替代方案在端到端音频分类上的性能研究
声音
2019-09-27 v3 机器学习
音频与语音处理
摘要
残差学习是近来提出的一种学习框架,用于促进极深神经网络的训练。残差块或单元由一组堆叠层构成,其中输入被加回其输出,旨在创建恒等映射。在实践中,此类恒等映射通过所谓的跳跃或残差连接实现。然而,关于此类跳跃连接应用于构成残差块的一组堆叠层中的何处,出现了多种实现替代方案。尽管用于卷积神经网络(CNNs)图像分类的 ResNet 架构已在文献中被广泛讨论,但迄今采用 ResNet 架构进行一维音频分类任务的工作很少。因此,不同残差块设计对原始音频分类的适用性在某种程度上尚属未知。本文旨在基于最先进的 CNN 架构,使用原始音频波形进行端到端音频分类,分析并讨论若干残差块实现的性能。为比较起见,我们还分析了在类似的二维架构下使用常规时频音频表示作为输入的残差块性能。结果表明,所达到的准确率不仅显著依赖于具体的残差块实现,还依赖于所选择的输入归一化。
引用
@article{arxiv.1906.10891,
title = {On the performance of residual block design alternatives in convolutional neural networks for end-to-end audio classification},
author = {Javier Naranjo-Alcazar and Sergi Perez-Castanos and Irene Martin-Morato and Pedro Zuccarello and Maximo Cobos},
journal= {arXiv preprint arXiv:1906.10891},
year = {2019}
}