中文

稀疏权重激活训练

机器学习 2020-11-03 v3 机器学习

摘要

神经网络训练在计算和内存方面都很密集。稀疏训练可以减轻旨在加速稀疏计算的新兴硬件平台的负担,但可能影响网络收敛。在这项工作中,我们提出了一种新颖的 CNN 训练算法——稀疏权重激活训练(SWAT)。SWAT 比常规训练更具计算和内存效率。SWAT 基于经验性洞察修改反向传播:训练过程中的收敛往往对以下消除操作具有鲁棒性:(i) 前向传播中幅值小的权重,以及 (ii) 反向传播中幅值小的权重和激活值。我们在 ResNet、VGG、DenseNet 和 WideResNet 等近期 CNN 架构上,使用 CIFAR-10、CIFAR-100 和 ImageNet 数据集评估 SWAT。对于 ImageNet 上的 ResNet-50,SWAT 将训练期间的总浮点运算(FLOPS)减少 80%,在代表新兴平台的模拟稀疏学习加速器上运行时实现 3.3×\times 的训练加速,同时仅导致 1.63% 的验证精度下降。此外,SWAT 在反向传播期间将激活值的内存占用减少 23% 至 50%,权重减少 50% 至 90%。

关键词

引用

@article{arxiv.2001.01969,
  title  = {Sparse Weight Activation Training},
  author = {Md Aamir Raihan and Tor M. Aamodt},
  journal= {arXiv preprint arXiv:2001.01969},
  year   = {2020}
}

备注

Published at NeurIPS 2020