通过对 Hessian 矩阵的隐式正则化稳定量化感知训练
计算机视觉与模式识别
2025-03-17 v1
摘要
量化感知训练(QAT)是当前主流的神经网络压缩方案之一。然而,由于量化误差不可避免,其稳定性受到挑战,导致性能下降。我们发现,导致性能急剧下降的尖锐损失景观是引起不稳定的关键因素。在理论上,我们发现特征中的扰动会带来平坦的局部极小值。然而,经验上,简单地向权重或特征添加扰动会恶化全精度(FP)模型的性能。在本文中,我们提出了特征扰动量化(FPQ),对特征进行随机扰动,并将特征蒸馏方法应用于量化模型。我们的方法能很好地泛化到不同的网络架构和各种 QAT 方法。此外,我们在数学上证明了 FPQ 隐式地正则化了 Hessian 范数,该校准了损失景观的平滑度。大量实验表明,我们的方法显著优于当前最先进(SOTA)的 QAT 方法,甚至优于对应的 FP 模型。
引用
@article{arxiv.2503.11159,
title = {Stabilizing Quantization-Aware Training by Implicit-Regularization on Hessian Matrix},
author = {Junbiao Pang and Tianyang Cai},
journal= {arXiv preprint arXiv:2503.11159},
year = {2025}
}
备注
9 pages, 5 figures