一种用于神经语言建模的随机Gossip BMUF过程
计算与语言
2020-03-02 v3
摘要
神经网络语言模型(NNLM)是工业级自动语音识别(ASR)系统的重要组成部分。训练NNLM的一个重要挑战是在扩展学习过程和处理大数据之间取得平衡。传统方法如块动量提供了一种分块模型更新过滤(BMUF)过程,在语音识别中实现了几乎线性的加速且无性能下降。然而,它需要计算来自所有计算节点(例如GPU)的模型平均值,当计算节点数量很大时,学习过程会遭受严重的通信延迟。因此,BMUF不适用于受限的网络条件。在本文中,我们提出了一种去中心化的BMUF过程,其中模型被分割成不同的组件,每个组件通过与一些随机选择的、具有相同组件的邻居节点通信来更新,随后进行类似BMUF的过程。我们将此方法应用于多个LSTM语言建模任务。实验结果表明,我们的方法始终比传统的BMUF获得更好的性能。特别是,在使用4个GPU的wiki-text-103基准测试上,我们获得了比单GPU基线更低的困惑度。此外,在扩展到8个和16个GPU时,未观察到性能下降。
引用
@article{arxiv.1909.09010,
title = {A Random Gossip BMUF Process for Neural Language Modeling},
author = {Yiheng Huang and Jinchuan Tian and Lei Han and Guangsen Wang and Xingcheng Song and Dan Su and Dong Yu},
journal= {arXiv preprint arXiv:1909.09010},
year = {2020}
}
备注
This paper is accepted in the technical program in ICASSP 2020. Session FR1.L3: Language Modeling, Location Room 118-119, Presentation Lecture,Presentation Time: Friday, 08 May, 09:40 - 10:00, Topic Human Language Technology:[HLT-LANG] Language Modeling