使用延迟梯度的完全解耦神经网络学习
计算机视觉与模式识别
2019-11-25 v3
摘要
使用反向传播(BP)训练神经网络需要依次传递激活值与梯度,这迫使网络模块以同步方式工作。这已被认为是 BP 所继承的锁(即前向、后向与更新锁)。本文中,我们提出一种使用延迟梯度(FDG)的完全解耦训练方案以打破所有这些锁。FDG 将神经网络拆分为多个模块,并使用不同工作器(如 GPU)独立且异步地训练它们。我们还引入了梯度收缩过程,以减轻由延迟梯度引起的陈旧梯度效应。此外,我们证明了所提 FDG 算法在训练期间保证统计收敛。实验通过在基准数据集上训练深度卷积神经网络执行分类任务进行,显示出相对于最先进方法以及 BP 在泛化与加速能力方面可比或更好的结果。特别地,我们表明 FDG 也能够训练极宽网络(如 WRN-28-10)与极深网络(如 ResNet-1202)。代码见 https://github.com/ZHUANGHP/FDG。
引用
@article{arxiv.1906.09108,
title = {Fully Decoupled Neural Network Learning Using Delayed Gradients},
author = {Huiping Zhuang and Yi Wang and Qinglai Liu and Shuai Zhang and Zhiping Lin},
journal= {arXiv preprint arXiv:1906.09108},
year = {2019}
}