在剪枝权重预算下完成全深度神经网络训练
机器学习
2019-11-26 v2 机器学习
摘要
我们提出了一种 DNN 训练技术,仅学习完整参数集的一部分而不产生精度损失。为此,我们的算法将反向传播期间更新的权重总数限制为具有最大总梯度的那些权重。其余权重不被跟踪,并在每次访问时重新生成其初始值,以避免将其存储在内存中。这可以显著减少训练和推理期间的片外存储器访问次数,而后者是 DNN 加速器能耗的关键组成部分。通过确保总权重扩散保持接近于基线未剪枝 SGD,使用我们的技术剪枝的网络能够在各种网络架构上保持最先进的精度——包括先前被认为难以压缩的网络,如 Densenet 和 WRN。在 ImageNet 上使用 ResNet18,我们观察到 11.7 的权重缩减且无精度损失,以及在轻微精度影响下高达 24.4 的缩减。
引用
@article{arxiv.1806.06949,
title = {Full deep neural network training on a pruned weight budget},
author = {Maximilian Golub and Guy Lemieux and Mieszko Lis},
journal= {arXiv preprint arXiv:1806.06949},
year = {2019}
}