用于原始波形的超深卷积神经网络
声音
2016-10-04 v1 机器学习
神经与进化计算
摘要
以最少的处理直接从原始波形数据中学习声学模型是一项具有挑战性的任务。当前基于波形的模型通常使用极少(约2层)的卷积层,这可能不足以构建高层判别性特征。在本工作中,我们提出了直接使用时域波形作为输入的超深卷积神经网络(CNN)。我们的CNN具有多达34个权重层,能够高效地在极长序列(例如大小为32000的向量)上进行优化,这对于处理声学波形是必要的。这通过批归一化、残差学习以及初始层中下采样的精心设计来实现。我们的网络是全卷积的,不使用全连接层和dropout,以最大化表示学习。我们在第一个卷积层中使用大的感受野来模拟带通滤波器,但随后使用非常小的感受野来控制模型容量。我们展示了更深层模型带来的性能提升。我们的评估表明,在一个环境声音识别任务中,具有18个权重层的CNN在绝对准确率上比具有3个权重层的CNN高出15%以上,并且与使用log-mel特征的模型性能相当。
引用
@article{arxiv.1610.00087,
title = {Very Deep Convolutional Neural Networks for Raw Waveforms},
author = {Wei Dai and Chia Dai and Shuhui Qu and Juncheng Li and Samarjit Das},
journal= {arXiv preprint arXiv:1610.00087},
year = {2016}
}
备注
5 pages, 2 figures, under submission to International Conference on Acoustics, Speech and Signal Processing (ICASSP) 2017