用于大词汇量连续语音识别的超深卷积神经网络进展
计算与语言
2016-06-28 v2 机器学习
神经与进化计算
摘要
具有小3x3核的超深CNN最近已被证明在混合NN-HMM语音识别系统中作为声学模型取得了非常强的性能。本文中,我们研究如何将这些模型高效扩展到更大数据集。具体而言,我们解决沿时间维度的池化和填充的设计选择问题,该选择导致序列的卷积评估效率极低。我们提出一种无时间填充且无时间池化的新CNN设计,其对精度略次优,但具有两个显著优势:它通过允许对完整语句进行高效卷积评估,实现了序列训练与部署;并且它允许批归一化直接应用于序列数据上的CNN。通过批归一化,我们恢复了因移除时间池化而损失的性能,同时保持了高效卷积评估的优势。我们展示了我们的模型在比以往更大规模数据上以及序列训练后的性能。我们在2000小时switchboard数据集上序列训练的超深CNN模型在Hub5测试集上获得9.4词错误率,以单一模型匹配了2015年IBM系统组合的性能,后者是先前发表的最佳结果。
引用
@article{arxiv.1604.01792,
title = {Advances in Very Deep Convolutional Neural Networks for LVCSR},
author = {Tom Sercu and Vaibhava Goel},
journal= {arXiv preprint arXiv:1604.01792},
year = {2016}
}
备注
Proc. Interspeech 2016