并行语音识别训练中的指数移动平均模型
计算与语言
2017-03-06 v1
摘要
随着训练数据的快速增长,目前多 GPU 集群的大规模并行训练已广泛应用于神经网络模型学习。我们提出了一种新方法,将指数移动平均方法应用于神经网络模型的大规模并行训练中。这是一种无干扰策略,在训练过程中的模型同步之后,指数移动平均模型不会被广播到分布式工作节点以更新其本地模型,而是作为训练系统的最终模型实现。使用所提方法成功训练了全连接前馈神经网络(DNN)和深度单向长短期记忆(LSTM)循环神经网络(RNN),用于神马普通话语音搜索数据的大词汇量连续语音识别。普通话语音识别的字符错误率(CER)较并行训练的现有方法进一步降低。
引用
@article{arxiv.1703.01024,
title = {Exponential Moving Average Model in Parallel Speech Recognition Training},
author = {Xu Tian and Jun Zhang and Zejun Ma and Yi He and Juan Wei},
journal= {arXiv preprint arXiv:1703.01024},
year = {2017}
}
备注
5 pages