在标准格式下以 4 位矩阵乘法实现精确神经网络训练
机器学习
2024-06-11 v4
摘要
权重和激活的量化是减少深度神经网络(DNNs)训练计算开销的主要方法之一。现有方法可实现前向阶段的 4 位量化。然而,这仅占训练过程的三分之一。要减少整个训练过程的计算开销,需要对神经梯度(即关于中间神经层输出的损失梯度)进行量化。先前工作分别表明,神经梯度的精确 4 位量化需要(1)无偏和(2)对数尺度。然而,此前没有工作旨在将这两种思想结合,正如我们在本工作中所做的那样。具体而言,我们考察了在量化神经网络训练中保持无偏量化的重要性、在何处保持它,以及如何将其与对数量化结合。基于此,我们提出了一种对数无偏量化(LUQ)方法,将前向和反向阶段均量化为 4 位,在无额外开销的情况下取得了 4 位训练的最先进结果。例如,在 ImageNet 上的 ResNet50 中,我们实现了 1.1% 的性能下降。我们通过高精度微调三个 epoch 并结合方差缩减方法,进一步将其改善为仅 0.32% 的下降——这两种方法的开销均与先前建议的方法相当。
引用
@article{arxiv.2112.10769,
title = {Accurate Neural Training with 4-bit Matrix Multiplications at Standard Formats},
author = {Brian Chmiel and Ron Banner and Elad Hoffer and Hilla Ben Yaacov and Daniel Soudry},
journal= {arXiv preprint arXiv:2112.10769},
year = {2024}
}