构建用于大词汇量语音识别的DNN声学模型
计算与语言
2015-01-21 v2 机器学习
神经与进化计算
机器学习
摘要
深度神经网络(DNN)现在是几乎所有最先进语音识别系统的核心组件。构建神经网络声学模型需要多个设计决策,包括网络架构、大小和训练损失函数。本文对DNN声学模型设计的哪些方面对语音识别系统性能最重要进行了实证研究。我们报告了DNN分类器性能和最终语音识别器的词错误率,并使用多个指标比较DNN,以量化影响任务性能差异的因素。我们的第一组实验使用标准的Switchboard基准语料库,包含约300小时的电话对话语音。我们将标准DNN与卷积网络进行比较,并首次使用局部连接、非共享权重的神经网络进行声学建模。此外,我们通过结合Switchboard和Fisher语料库,在2100小时训练数据的语料库上构建系统。这个更大的语料库使我们能够更彻底地检查大型DNN模型的性能——其参数数量比语音识别系统中通常使用的多十倍。我们的结果表明,相对简单的DNN架构和优化技术能产生强劲的结果。这些发现,连同先前的工作,有助于建立一套使用最大似然训练构建DNN混合语音识别系统的最佳实践。我们的DNN优化实验还作为使用判别性损失函数训练DNN用于语音任务以及更一般的DNN分类器的案例研究。
引用
@article{arxiv.1406.7806,
title = {Building DNN Acoustic Models for Large Vocabulary Speech Recognition},
author = {Andrew L. Maas and Peng Qi and Ziang Xie and Awni Y. Hannun and Christopher T. Lengerich and Daniel Jurafsky and Andrew Y. Ng},
journal= {arXiv preprint arXiv:1406.7806},
year = {2015}
}