CPT-V:一种用于视觉Transformer训练后量化的对比方法
计算机视觉与模式识别
2023-01-10 v2 人工智能
摘要
在考虑训练后量化时,先前工作通常聚焦于开发混合精度方案或学习量化网络的最佳划分方式。在我们的工作CPT-V中,我们着眼于一种通用方法,通过扰动量化尺度来提升已量化网络的精度。借鉴自监督学习中的对比损失思想,我们找到了一种仅使用1,000张校准图像联合最小化损失函数的鲁棒方式。为确定性能最佳的量化尺度,CPT-V以自监督方式对比量化模型与全精度模型的特征。不同于传统的基于重建的损失函数,对比损失函数的使用不仅奖励量化与全精度输出间的相似性,还有助于将量化输出与给定批次内其他输出区分开。此外,与先前工作相反,CPT-V提出一种块级进化搜索以最小化全局对比损失目标,从而允许提升现有视觉Transformer(ViT)量化方案的精度。例如,CPT-V将全量化ViT-Base在3-bit、4-bit与8-bit权重量化水平下的top-1精度分别提升了10.30%、0.78%与0.15%。在多种其他ViT架构上的大量实验进一步证明了其在极端量化场景下的鲁棒性。我们的代码可在<link>获取。
引用
@article{arxiv.2211.09643,
title = {CPT-V: A Contrastive Approach to Post-Training Quantization of Vision Transformers},
author = {Natalia Frumkin and Dibakar Gope and Diana Marculescu},
journal= {arXiv preprint arXiv:2211.09643},
year = {2023}
}