中文

面向Segment Anything Model 2的准确量化方法:Q-SAM2

计算机视觉与模式识别 2025-11-25 v2 人工智能

摘要

Segment Anything Model 2 (SAM2) 是一个强大的可提示分割基础模型,但其高计算和内存成本是部署在资源受限设备上的主要障碍。本文提出了Q-SAM2,一种准确的低位量化方法,实现高压缩率和高保真度。为解决量化过程中刻薄的权重和激活分布导致的性能下降,Q-SAM2引入了两个新颖贡献:方差缩减校准 (VRC),这是一种通过在小型校准批上最小化弗罗贝尼乃斯范数来减少权重统计方差的初始化方法;可学习统计裁剪 (LSC),这是一种量化感知训练 (QAT) 方法,通过学习动量稳定裁剪因子来管理权重和激活中的离群值。全面实验表明,Q-SAM2在保持高效能的同时实现高度准确的推理,显著优于最先进的通用QAT方案,尤其在超低2位 regime 下。具体而言,Q-SAM2在视频分割基准测试中在J&F上实现了最高达9.7百分点的准确率提升,在实例分割上实现7.3百分点的mIoU提升,同时相较于BF16基线实现了8倍的模型大小缩减。

关键词

引用

@article{arxiv.2506.09782,
  title  = {Q-SAM2: Accurate Quantization for Segment Anything Model 2},
  author = {Nicola Farronato and Florian Scheidegger and Mattia Rigotti and Cristiano Malossi and Michele Magno and Haotong Qin},
  journal= {arXiv preprint arXiv:2506.09782},
  year   = {2025}
}

备注

22 pages