CAR-SAM:基于交叉注意力重构的Segment Anything模型后训练量化
计算机视觉与模式识别
2026-05-19 v1
摘要
Segment Anything Models (SAM) 在计算机视觉中被广泛用于通用图像分割,但由于其高计算和内存需求,在资源受限设备上部署具有挑战性。后训练量化(PTQ)是一种广泛使用的模型压缩和加速技术。然而,现有PTQ方法未能考虑到SAM解码器中的交叉注意力架构,这一降级主要源于SAM所特有的挑战:(1)注意力耗散——在低位量化下,解码器中的注意力信息(对于表示分割掩码至关重要)会退化为扩散且非语义化的形式;(2)重构振荡——双向变换器中的双向耦合引入了跨分支误差干扰,导致收敛不稳定。为解决上述问题,我们提出CAR-SAM,一个针对SAM的统一量化框架。首先,为缓解注意力耗散,我们引入矩阵乘法感知补偿(MAC)机制,将由线性权重引起的激活量化误差从矩阵乘法转移到前导线性权重上。其次,为缓解解码器优化中的振荡,我们开发了联合交叉注意力重构(JCAR)策略,联合重构耦合的注意力分支,以抑制振荡行为并促进稳定收敛。大量实验表明,CAR-SAM能够稳健地将SAM模型量化至4位精度,在SAM-B和SAM-L上分别超过现有方法14.6%和6.6%的mAP。
引用
@article{arxiv.2605.16901,
title = {CAR-SAM: Cross-Attention Reconstruction for Post-Training Quantization of the Segment Anything Model},
author = {Houji Wen and Jiangyong Yu and Jun Li and Dawei Yang},
journal= {arXiv preprint arXiv:2605.16901},
year = {2026}
}