AdaLog:面向视觉 Transformer 的自适应 logarithm 量化后训练方法
计算机视觉与模式识别
2024-07-19 v1
摘要
视觉 Transformer (ViT) 已成为计算机视觉社区中最流行的基本骨干网络之一。尽管其高准确率,但在实际应用中部署仍面临高计算成本和推理延迟的挑战。最近,后训练量化 (PTQ) 技术已成为提高 ViT 效率的有前景的方法。然而,现有的 ViT 后训练量化方法在后 Softmax 和后 GELU 激活函数上采用固定量化,无法适应遵循幂律分布的激活函数。为此,我们提出一种新型非均匀量化器,称为自适应 logarithm AdaLog (AdaLog) 量化器。它优化对激活函数幂律分布的适应,同时允许硬件友好的量化和去量化。通过采用偏置再参数化,AdaLog 量化器可同时适用于后 Softmax 和后 GELU 激活函数。此外,我们开发了一种高效的快速渐进组合搜索 (FPCS) 策略,用于确定 AdaLog 的最优 logarithm 基数,以及均匀量化器的比例因子和零点。广泛的实验结果表明,我们的方法在各种 ViT 架构和视觉任务上(包括分类、目标检测和实例分割)均显示出色。代码已公开:https://github.com/GoatWu/AdaLog。
引用
@article{arxiv.2407.12951,
title = {AdaLog: Post-Training Quantization for Vision Transformers with Adaptive Logarithm Quantizer},
author = {Zhuguanyu Wu and Jiaxin Chen and Hanwen Zhong and Di Huang and Yunhong Wang},
journal= {arXiv preprint arXiv:2407.12951},
year = {2024}
}
备注
Accepted to ECCV 2024