PTQ4SAM:面向Segment Anything的后训练量化
计算机视觉与模式识别
2024-05-07 v1 机器学习
摘要
Segment Anything Model (SAM) 在许多计算机视觉任务中取得了令人印象深刻的性能。然而,作为一个大规模模型,其巨大的内存和计算成本阻碍了实际部署。在本文中,我们提出了一个面向Segment Anything Model的后训练量化(PTQ)框架,即PTQ4SAM。首先,我们研究了SAM量化的固有瓶颈,该瓶颈归因于Key-Linear后激活的双峰分布。我们从逐张量和逐通道两个角度分析了其特征,并提出了一种双峰整合策略,该策略利用数学上等价的符号运算将双峰分布离线转换为相对易于量化的正态分布。其次,SAM包含多种注意力机制(即自注意力和双向交叉注意力),导致Softmax后分布存在显著差异。因此,我们引入了一种自适应粒度量化方法用于Softmax,通过搜索最优的2的幂次基数,该方法对硬件友好。在多种视觉任务(实例分割、语义分割和目标检测)、数据集和模型变体上的大量实验结果显示了PTQ4SAM的优越性。例如,将SAM-L量化为6比特时,我们在实例分割上实现了无损精度,理论加速3.9倍,精度下降约0.5%。代码可在\url{https://github.com/chengtao-lv/PTQ4SAM}获取。
引用
@article{arxiv.2405.03144,
title = {PTQ4SAM: Post-Training Quantization for Segment Anything},
author = {Chengtao Lv and Hong Chen and Jinyang Guo and Yifu Ding and Xianglong Liu},
journal= {arXiv preprint arXiv:2405.03144},
year = {2024}
}
备注
CVPR 2024