面向 LVCSR 的深度卷积神经网络改进
机器学习
2013-12-11 v3 计算与语言
神经与进化计算
最优化与控制
机器学习
摘要
深度卷积神经网络(CNN)比深度神经网络(DNN)更强大,因为它们能够更好地减少输入信号中的频谱变化。这一点也在实验中得到了证实,在各种 LVCSR 任务中,与 DNN 相比,CNN 的词错误率(WER)相对降低了 4-12%。在本文中,我们描述了进一步改进 CNN 性能的不同方法。首先,我们结合最先进的特征,对有限权重共享和全权重共享进行了深入分析比较。其次,我们将各种已在计算机视觉中显示出改进的池化策略应用于 LVCSR 语音任务。第三,我们引入了一种将说话人自适应(即 fMLLR)有效整合到 log-mel 特征中的方法。第四,我们提出了一种在 Hessian-free 序列训练期间有效使用 dropout 的策略。我们发现,通过这些改进,特别是利用 fMLLR 和 dropout,我们在 50 小时的广播新闻任务上,相较于之前最佳的 CNN 基线,实现了额外 2-3% 的相对 WER 改进。在更大的 400 小时 BN 任务上,我们发现相较于之前最佳的 CNN 基线,实现了额外 4-5% 的相对改进。
引用
@article{arxiv.1309.1501,
title = {Improvements to deep convolutional neural networks for LVCSR},
author = {Tara N. Sainath and Brian Kingsbury and Abdel-rahman Mohamed and George E. Dahl and George Saon and Hagen Soltau and Tomas Beran and Aleksandr Y. Aravkin and Bhuvana Ramabhadran},
journal= {arXiv preprint arXiv:1309.1501},
year = {2013}
}
备注
6 pages, 1 figure