近乎无损的自适应位宽切换
计算机视觉与模式识别
2025-02-04 v1 人工智能
摘要
模型量化被广泛应用于压缩和加速深度神经网络(DNN)。然而,传统的量化感知训练(QAT)侧重于训练具有均匀位宽的 DNN。位宽设置因不同硬件和传输需求而异,这导致了相当大的训练和存储成本。因此,一次性联合训练多种精度的方案被提出来解决这个问题。以往的工作要么存储一个较大的 FP32 模型以在不同精度模型之间切换以获得更高精度,要么存储一个较小的 INT8 模型,但由于使用共享量化参数而牺牲了精度。在本文中,我们引入了双舍入量化方法,该方法充分利用量化表示范围来实现近乎无损的位宽切换,同时通过使用最高整数精度而非全精度来减少存储。此外,我们观察到在一次联合训练期间,不同精度之间存在竞争性干扰,这主要是由于反向传播过程中量化尺度梯度不一致造成的。为了解决这个问题,我们提出了一种自适应学习率缩放(ALRS)技术,该技术动态调整各种精度的学习率以优化训练过程。此外,我们将双舍入扩展到一次性混合精度训练,并开发了一种基于 Hessian 感知的随机位宽切换(HASB)策略。在 ImageNet-1K 分类上的实验结果表明,我们的方法在多精度和混合精度方面均优于最先进的一次性联合 QAT。我们还在检测和分割任务以及 LLMs 任务上验证了该方法的可行性。我们的代码可在 https://github.com/haiduo/Double-Rounding 获取。
引用
@article{arxiv.2502.01199,
title = {Nearly Lossless Adaptive Bit Switching},
author = {Haiduo Huang and Zhenhua Liu and Tian Xia and Wenzhe zhao and Pengju Ren},
journal= {arXiv preprint arXiv:2502.01199},
year = {2025}
}