深度循环卷积神经网络:提升语音识别性能
计算与语言
2016-12-28 v2 机器学习
摘要
深度学习方法已广泛应用于序列建模问题。在自动语音识别(ASR)方面,通过增加大规模语音语料库和更深的神经网络,其性能得到了显著提升。特别是,循环神经网络和深度卷积神经网络已成功应用于 ASR。鉴于训练速度方面出现的问题,我们构建了一种新颖的深度循环卷积网络用于声学建模,并对其应用了深度残差学习。我们的实验表明,与传统的深度卷积循环网络相比,它不仅具有更快的收敛速度,而且具有更好的识别准确率。在实验中,我们比较了新颖的深度循环卷积网络与传统深度卷积循环网络的收敛速度。凭借更快的收敛速度,我们的新颖深度循环卷积网络可以达到相当的性能。我们进一步表明,应用深度残差学习可以提升我们新颖深度循环卷积网络的收敛速度。最后,我们使用所提出的双向统计 n-gram 语言模型,通过音素错误率(PER)评估了所有实验网络。评估结果表明,我们新提出的应用了深度残差学习的深度循环卷积网络在 TIMIT 数据库上可以达到 17.33% 的最佳 PER,且收敛速度最快。我们新颖的带有深度残差学习的深度循环卷积神经网络的出色性能表明,它有可能被应用于其他序列问题。
引用
@article{arxiv.1611.07174,
title = {Deep Recurrent Convolutional Neural Network: Improving Performance For Speech Recognition},
author = {Zewang Zhang and Zheng Sun and Jiaqi Liu and Jingwen Chen and Zhao Huo and Xiao Zhang},
journal= {arXiv preprint arXiv:1611.07174},
year = {2016}
}
备注
11 pages, 13 figures