中文

使用模型平均并行训练深度神经网络的实验

机器学习 2018-07-03 v3 神经与进化计算

摘要

本文我们将模型平均应用于深度神经网络(DNN)的并行训练。并行化以模型平均方式进行。数据被划分并分发到不同节点进行局部模型更新,每隔几个小批量就在节点间进行模型平均。我们使用多个GPU进行数据并行化,并使用消息传递接口(MPI)进行节点间通信,这使我们能够频繁进行模型平均而不会在通信上损失太多时间。我们研究了自然梯度随机梯度下降(NG-SGD)和受限玻尔兹曼机(RBM)预训练在模型平均框架下对并行训练的有效性,并探索了不同学习率调度、平均频率和小批量大小方面的最佳设置。结果表明,NG-SGD和RBM预训练有益于基于参数平均的模型训练。在300小时Switchboard数据集上,使用16个GPU实现了9.3倍加速,使用32个GPU实现了17倍加速,且解码精度损失有限。

关键词

引用

@article{arxiv.1507.01239,
  title  = {Experiments on Parallel Training of Deep Neural Network using Model Averaging},
  author = {Hang Su and Haoyu Chen},
  journal= {arXiv preprint arXiv:1507.01239},
  year   = {2018}
}