面向低位视觉Transformer的无振荡量化方法
计算机视觉与模式识别
2023-09-20 v3 人工智能
硬件体系结构
机器学习
摘要
权重振荡是量化感知训练中一个不良的副作用,表现为量化后的权重频繁在两个量化级别之间跳变,导致训练不稳定和次优的最终模型。我们发现,可学习的缩放因子——量化中广泛使用的默认设置——会加剧权重振荡。本研究探讨了可学习缩放因子与量化权重振荡之间的联系,并以ViT作为案例来阐述相关发现和补救措施。此外,我们还发现自注意力层中查询(query)和键(key)的量化权重之间的相互依赖性使ViT容易受到振荡影响。为此,我们相应提出了三种技术:统计权重量化(StatsQ),与主流的基于可学习缩放的方法相比,可提高量化鲁棒性;置信度引导退火(CGA),冻结具有高置信度的权重并平息振荡的权重;以及查询-键重参数化(QKR),以解决查询-键交织振荡并缓解由此产生的梯度估计偏差。大量实验表明,这些提出的技术成功抑制了权重振荡,并在ImageNet上持续实现了显著的精度提升。具体而言,我们的2位DeiT-T/DeiT-S算法分别比先前的最先进方法高出9.8%和7.7%。代码和模型可在以下链接获取:https://github.com/nbasyl/OFQ。
引用
@article{arxiv.2302.02210,
title = {Oscillation-free Quantization for Low-bit Vision Transformers},
author = {Shih-Yang Liu and Zechun Liu and Kwang-Ting Cheng},
journal= {arXiv preprint arXiv:2302.02210},
year = {2023}
}
备注
Proceedings of the 40 th International Conference on Machine Learning, Honolulu, Hawaii, USA. PMLR 202, 2023