1位FQT:将全量化训练推向1位极限
机器学习
2024-08-27 v1 计算机视觉与模式识别
摘要
全量化训练(FQT)通过量化激活、权重和梯度到较低精度来加速深度神经网络的训练。为了探索FQT的极限(可达到的最低精度),我们首次尝试了1位FQT。我们提供了基于Adam和SGD的FQT的理论分析,揭示了梯度方差影响FQT的收敛性。基于这些理论结果,我们引入了一种梯度剪枝(AGP)策略。该策略利用梯度的异质性,通过剪枝信息量较少的梯度并提高剩余梯度的数值精度来缓解梯度方差问题。此外,我们提出了样本通道联合量化(SCQ),它在计算权重梯度和激活梯度时采用不同的量化策略,以确保该方法对低位宽硬件友好。最后,我们提出了一个部署我们算法的框架。在多个数据集上微调VGGNet-16和ResNet-18时,与逐样本量化相比,我们的算法平均准确率提高了约6%。此外,与全精度训练相比,我们的训练加速最高可达5.13倍。
引用
@article{arxiv.2408.14267,
title = {1-Bit FQT: Pushing the Limit of Fully Quantized Training to 1-bit},
author = {Chang Gao and Jianfei Chen and Kang Zhao and Jiaqi Wang and Liping Jing},
journal= {arXiv preprint arXiv:2408.14267},
year = {2024}
}