基于1-Max池化卷积神经网络的鲁棒音频事件识别
神经与进化计算
2016-06-23 v2 机器学习
声音
摘要
本文提出一种简单而高效的卷积神经网络(CNN)架构,用于鲁棒音频事件识别。与具有多个卷积层和池化层并堆叠多个全连接层的深度CNN架构不同,所提出的网络仅由三层组成:卷积层、池化层和softmax层。区别于针对该任务提出的深度架构的另外两个特征是:卷积层采用变尺寸卷积滤波器,以及池化层采用1-max池化方案。直观上,该网络倾向于从整个音频信号中选择最具判别性的特征进行识别。我们提出的CNN不仅在鲁棒音频事件识别标准任务上展现出最先进的性能,而且在识别准确率上优于其他深度架构达4.5%,相当于76.3%的相对错误率降低。
引用
@article{arxiv.1604.06338,
title = {Robust Audio Event Recognition with 1-Max Pooling Convolutional Neural Networks},
author = {Huy Phan and Lars Hertel and Marco Maass and Alfred Mertins},
journal= {arXiv preprint arXiv:1604.06338},
year = {2016}
}
备注
To appear in Proceedings of Interspeech 2016