SAQ-SAM:面向 Segment Anything Model 的语义对齐量化
计算机视觉与模式识别
2025-11-18 v2
摘要
Segment Anything Model(SAM)展现出卓越的零样本分割能力;然而,其高昂的计算成本使得边缘部署极具挑战性。尽管训练后量化(PTQ)提供了一种有前景的压缩解决方案,但由于 SAM 专用的模型组件和可提示的工作流程,现有方法在应用于 SAM 时结果并不令人满意:(i) 掩码解码器的注意力表现出极端的激活异常值,我们发现激进的截断(甚至 100 倍)在不进行平滑或隔离的情况下,能够有效抑制异常值并保持性能。遗憾的是,传统的基于分布的度量(如 MSE)无法提供如此大规模的截断。(ii) 现有的量化重建方法忽略了 SAM 的语义交互性,导致图像特征与提示意图之间的错位。为了解决上述问题,我们在本文中提出了 SAQ-SAM,从语义对齐的角度提升了 SAM 的 PTQ。具体而言,我们提出了感知一致性截断,利用注意力焦点重叠来促进激进截断,同时保留语义能力。此外,我们提出了提示感知重建,通过利用掩码解码器中的交叉注意力来结合图像-提示交互,从而在分布和语义上促进对齐。此外,为了确保交互效率,我们为编码器中的图像 token 设计了层跳过策略。我们在各种 SAM 规模和任务上进行了广泛实验,包括实例分割、定向目标检测和语义分割,结果表明我们的方法持续展现出优势。例如,在将 SAM-B 量化为 4-bit 时,SAQ-SAM 在实例分割任务中的 mAP 比基线高 11.7%。
引用
@article{arxiv.2503.06515,
title = {SAQ-SAM: Semantically-Aligned Quantization for Segment Anything Model},
author = {Jing Zhang and Zhikai Li and Chengzhi Hu and Xuewen Liu and Qingyi Gu},
journal= {arXiv preprint arXiv:2503.06515},
year = {2025}
}
备注
AAAI 2026. Code is available at https://github.com/jingjing0419/SAQ-SAM