中文

用于大词汇量连续语音识别的极深多语言卷积神经网络

计算与语言 2016-01-26 v2 神经与进化计算

摘要

卷积神经网络(CNNs)是当前许多最先进的大词汇量连续语音识别(LVCSR)系统的标准组件。然而,LVCSR 中的 CNN 未能跟上其他领域中更深神经网络提供优越性能的最新进展。本文中,我们提出了若干用于 LVCSR 的 CNN 架构改进。首先,我们引入了具有多达 14 个权重层的极深卷积网络架构。受 VGG Imagenet 2014 架构启发,在每个池化层之前有多个卷积层,使用 3x3 小核。然后,我们引入了具有多个不绑定层的多语言 CNN。最后,我们引入了多尺度输入特征,旨在以可忽略的计算代价利用更多上下文。我们首先在 Babel 低资源语音识别任务上评估改进,通过在六种不同语言的合并数据上训练我们的 CNN,获得了相对于基线 PLP DNN 绝对 5.77% 的 WER 提升。随后我们在 Hub5'00 基准(使用 262 小时的 SWB-1 训练数据)上评估极深 CNN,在交叉熵训练后达到 11.8% 的词错误率,比迄今为止最佳已发表 CNN 结果绝对提升 1.4% WER(相对 10.6%)。

关键词

引用

@article{arxiv.1509.08967,
  title  = {Very Deep Multilingual Convolutional Neural Networks for LVCSR},
  author = {Tom Sercu and Christian Puhrsch and Brian Kingsbury and Yann LeCun},
  journal= {arXiv preprint arXiv:1509.08967},
  year   = {2016}
}

备注

Accepted for publication at ICASSP 2016