面向LSTM及更广泛模型的大批量训练
机器学习
2019-01-25 v1 机器学习
摘要
大批量训练方法已使研究者能够利用大规模分布式处理并极大加速深度神经网络(DNN)训练。例如,通过将批量大小从256扩展到32K,研究者已将ImageNet上ResNet50的训练时间从29小时缩短至2.2分钟(Ying et al., 2018)。本文提出一种称为线性周期渐进预热(LEGW)的新方法以改进大批量训练。借助LEGW,我们能够对CNN和RNN均采用Sqrt Scaling(平方根缩放)方案进行大批量训练。LEGW使Sqrt Scaling方案在实践中变得有用,因此我们取得了远优于Linear Scaling(线性缩放)学习率方案的结果。对于LSTM应用,我们能够将批量大小放大64倍而不损失精度且无需调节超参数。对于CNN应用,即便将批量大小扩至32K,LEGW仍能达到相同精度。LEGW优于以往的大批量自动调优技术。在相同硬件上,LEGW对四种基于LSTM的应用实现了较基线平均5.3倍的加速。我们也给出了对LEGW的若干理论解释。
引用
@article{arxiv.1901.08256,
title = {Large-Batch Training for LSTM and Beyond},
author = {Yang You and Jonathan Hseu and Chris Ying and James Demmel and Kurt Keutzer and Cho-Jui Hsieh},
journal= {arXiv preprint arXiv:1901.08256},
year = {2019}
}
备注
Preprint. Work in progress. We may update this draft recently