中文

面向视觉 Transformer 的架构感知后训练量化方法——AIQViT

计算机视觉与模式识别 2025-02-10 v1

摘要

后训练量化(PTQ)已成为降低视觉 Transformer(ViT)存储和计算成本的有前景方案。近期进展主要针对处理 ViT 特征 activations 的独特特性所设计的量化器。然而,大多数现有方法低估了权重量化所带来的信息损失,导致尤其在低比特情况下性能显著下降。此外,针对 ViT 的后 Softmax 激活值,常见的做法是采用对数变换,这不幸优先处理围绕零值的较少信息值。这种方法引入额外的冗余,最终导致量化效果次优。为处理这些问题,本文提出一种针对 ViT 的创新 PTQ 方法,称为 AIQViT(Architecture-Informed Post-training Quantization for ViTs)。首先,我们设计了一种架构感知的低秩补偿机制,引入可学习的低秩权重以补偿权重量化所导致的性能下降。其次,我们设计了一种动态聚焦量化器,以适应后 Softmax 激活值的不均衡分布,动态选择最有价值的区间以获得更高的量化分辨率。在包括图像分类、目标检测、实例分割、点云分类和点云部分分割等五个视觉任务上的大量实验表明,AIQViT 在与最先进 PTQ 方法相比时具有优势。

关键词

引用

@article{arxiv.2502.04628,
  title  = {AIQViT: Architecture-Informed Post-Training Quantization for Vision Transformers},
  author = {Runqing Jiang and Ye Zhang and Longguang Wang and Pengpeng Yu and Yulan Guo},
  journal= {arXiv preprint arXiv:2502.04628},
  year   = {2025}
}