面向视觉变换器的精确训练后量化
计算机视觉与模式识别
2023-03-28 v1
摘要
视觉变换器作为一种有潜力的视觉任务架构而出现。然而,巨大的计算量与非可忽略的延迟阻碍了其在实际中的应用。作为一种广泛的模型压缩技术,现有的训练后量化方法仍导致严重的性能下降。我们发现主要原因在于:(1) 现有的校准度量在衡量极低比特表示下的量化影响时不准确;(2) 现有的量化范式对 Softmax 的幂律分布不友好。基于这些观察,我们提出了一种新颖的面向视觉变换器的精确训练后量化框架,即 APQ-ViT。我们首先提出统一的自底消除分块校准方案,以优化校准度量,从而以分块方式感知整体量化扰动,并优先处理对最终输出影响更大的关键量化误差。然后,我们设计了保持马太效应的 Softmax 量化,以维持幂律特征并保留注意力机制的功能。在大规模分类与检测数据集上的综合实验表明,我们的 APQ-ViT 以令人信服的幅度超越了现有的训练后量化方法,尤其在更低比特宽度设置下(例如,在 W4A4 上分类平均提升达 5.17%,检测达 24.43%)。我们还强调 APQ-ViT 具有通用性,可良好地作用于多种变换器变体。
引用
@article{arxiv.2303.14341,
title = {Towards Accurate Post-Training Quantization for Vision Transformer},
author = {Yifu Ding and Haotong Qin and Qinghua Yan and Zhenhua Chai and Junjie Liu and Xiaolin Wei and Xianglong Liu},
journal= {arXiv preprint arXiv:2303.14341},
year = {2023}
}
备注
9 pages, 5 figures, accepted by ACM Multimedia 2022