中文

使用陈旧权重的深度卷积神经网络流水线训练

分布式、并行与集群计算 2020-01-01 v1 机器学习

摘要

卷积神经网络(CNN)复杂度的增长,增加了在训练期间将网络划分到多个加速器上并通过加速器流水线执行反向传播计算的兴趣。现有方法通过微批处理或权重暂存等技术避免或限制陈旧权重的使用。这些技术要么未充分利用加速器,要么增加了内存占用。我们探究了一种最大化加速器利用率且保持适度内存开销的流水线反向传播方案中,陈旧权重对统计效率与性能的影响。我们使用4种CNN(LeNet-5、AlexNet、VGG和ResNet),表明当流水线仅限于网络的前几层时,使用陈旧权重训练能够收敛,并在MNIST和CIFAR-10数据集上得到与非流水线训练推理准确率相当的模型;四个网络的准确率分别下降0.4%、4%、0.83%和1.45%。然而,当流水线位于网络中较深层时,推理准确率显著下降。我们提出在混合方案中结合流水线与非流水线训练以解决该下降。我们在2块GPU上使用ResNet在PyTorch中实现了流水线反向传播并展示其性能,相较1-GPU基线实现高达1.8倍的加速,且推理准确率仅有小幅下降。

关键词

引用

@article{arxiv.1912.12675,
  title  = {Pipelined Training with Stale Weights of Deep Convolutional Neural Networks},
  author = {Lifu Zhang and Tarek S. Abdelrahman},
  journal= {arXiv preprint arXiv:1912.12675},
  year   = {2020}
}