神经梯度近似对数正态:改进的量化与稀疏训练
计算机视觉与模式识别
2020-10-13 v3 机器学习
摘要
虽然训练大多可通过减少将神经梯度反向传播至整个模型所需的时间来加速,但以往多数工作聚焦于权重和激活的量化/剪枝。这些方法通常不适用于具有非常不同统计性质的神经梯度。与权重和激活不同,我们发现神经梯度的分布近似为对数正态。考虑到这一点,我们提出两种闭式解析方法来降低神经梯度的计算和内存负担。第一种方法优化梯度的浮点格式和尺度。第二种方法精确设定梯度剪枝的稀疏性阈值。每种方法在 ImageNet 上均达到最先进结果。据我们所知,本文首次 (1) 将梯度量化为 6 位浮点格式,或 (2) 实现高达 85% 的梯度稀疏度——在每种情况下均无精度下降。论文附有参考实现。
引用
@article{arxiv.2006.08173,
title = {Neural gradients are near-lognormal: improved quantized and sparse training},
author = {Brian Chmiel and Liad Ben-Uri and Moran Shkolnik and Elad Hoffer and Ron Banner and Daniel Soudry},
journal= {arXiv preprint arXiv:2006.08173},
year = {2020}
}