I&S-ViT:一种包容且稳定的推动训练后ViT量化极限的方法
计算机视觉与模式识别
2025-10-10 v3
摘要
尽管视觉Transformer(ViT)具有可扩展的性能,但其密集的计算成本(训练与推理)削弱了它们在工业应用中的地位。训练后量化(PTQ)利用微小数据集对ViT进行调优并以低比特格式运行,很好地解决了成本问题,但在更低比特情况下不幸地承受了更多的性能下降。本文提出I&S-ViT,一种以包容且稳定方式规范ViT的PTQ的新方法。I&S-ViT首先识别出ViT的PTQ中的两个问题:(1)主流log2量化器对Softmax后激活值的量化效率低下;(2)LayerNorm后激活值在粗粒度量化粒度下存在崎岖且放大的损失景观。随后,I&S-ViT通过引入以下内容解决这些问题:(1)一种新颖的移位均匀log2量化器(SULQ),其结合移位机制与随后的均匀量化,以实现包容的域表示与精确的分布近似;(2)一种三阶段平滑优化策略(SOS),融合通道级与层量级量化的优势以实现稳定学习。跨多种视觉任务的全面评估验证了I&S-ViT相对于现有ViT的PTQ方法的优越性,尤其在低比特场景中。例如,I&S-ViT将3比特ViT-B的性能显著提升50.68%。
引用
@article{arxiv.2311.10126,
title = {I&S-ViT: An Inclusive & Stable Method for Pushing the Limit of Post-Training ViTs Quantization},
author = {Yunshan Zhong and Jiawei Hu and Mingbao lin and Mengzhao Chen and Rongrong Ji},
journal= {arXiv preprint arXiv:2311.10126},
year = {2025}
}
备注
This paper has been accepted by TPAMI2025