中文

MixA-Q:从混合精度量化视角重新审视视觉Transformer的激活稀疏性

计算机视觉与模式识别 2025-07-28 v1

摘要

本文提出MixA-Q,一种混合精度激活量化框架,利用层内激活稀疏性(一种在激活剪枝方法中广泛探索的概念)实现量化窗口式视觉Transformer的高效推理。对于给定的均匀位宽量化配置,MixA-Q分离Swin块内的批量窗口计算,并为较不重要窗口的激活分配更低位宽,从而改善模型性能与效率之间的权衡。我们引入双分支Swin块,分别以高精度和低精度处理激活,使得我们的方法能够无缝集成到大多数量化感知训练(QAT)和后训练量化(PTQ)方法中,或仅需简单修改即可集成。我们在COCO数据集上的实验评估表明,MixA-Q在PTQ配置下实现了无需训练的1.35倍计算加速,且无精度损失。结合QAT,MixA-Q实现了无损的1.25倍加速;通过引入激活剪枝,在仅损失1% mAP的情况下实现了1.53倍加速。值得注意的是,通过减少重要区域的量化误差,我们的稀疏感知量化自适应方法将量化后的W4A4模型(权重和激活均为4位精度)的mAP提升了0.7%,将量化退化降低了24%。

关键词

引用

@article{arxiv.2507.19131,
  title  = {MixA-Q: Revisiting Activation Sparsity for Vision Transformers from a Mixed-Precision Quantization Perspective},
  author = {Weitian Wang and Rai Shubham and Cecilia De La Parra and Akash Kumar},
  journal= {arXiv preprint arXiv:2507.19131},
  year   = {2025}
}

备注

Accepted to ICCV 2025