Mix-QViT:基于层重要性和量化灵敏性的混合精度视觉 Transformer 量化
计算机视觉与模式识别
2025-01-14 v1
摘要
本文提出了 Mix-QViT,一种以可解释性为导向的混合精度量化框架,系统地根据两项标准为每个层分配位宽:一种是通过基于层相关性传播 (LRP) 评估的层重要性,该方法识别每个层对最终分类贡献的多少;另一种是通过在保持其他层在基准水平下的情况下,对每个层在各种精度水平进行量化以评估其性能影响,从而确定的量化灵敏度。此外,对于后训练量化 (PTQ),我们引入了一种裁剪通道级量化方法,旨在通过消除严重的通道间变异来减少后 LayerNorm 激活函数中极端离群值的影响。我们通过将 Mix-QViT 应用于 ViT、DeiT 和 Swin Transformer 模型并在多个数据集上进行实验来验证我们的方案。我们的 PTQ 实验结果表明,固定位宽和混合位宽方法均优于现有技术,尤其在 3 位、4 位和 6 位精度下。此外,在量化感知训练中,Mix-QViT 在 2 位混合精度下实现了卓越的性能。
引用
@article{arxiv.2501.06357,
title = {Mix-QViT: Mixed-Precision Vision Transformer Quantization Driven by Layer Importance and Quantization Sensitivity},
author = {Navin Ranjan and Andreas Savakis},
journal= {arXiv preprint arXiv:2501.06357},
year = {2025}
}
备注
Journal, 12 pages, 7 figures