中文

InfoSAM:从信息论视角微调 Segment Anything Model

计算机视觉与模式识别 2025-06-04 v2

摘要

Segment Anything Model (SAM) 作为一种视觉基础模型,在通用任务中展现出令人印象深刻的零样本能力,但在专业领域中表现不佳。参数高效微调 (PEFT) 是在全新场景中释放 SAM 潜力的一种有前景的方法。然而,现有的针对 SAM 的 PEFT 方法忽略了预训练模型中编码的域不变关系。为了弥合这一差距,我们提出了 InfoSAM,这是一种信息论方法,通过提取并保留其预训练的分割知识来增强 SAM 微调。具体而言,我们将知识转移过程表述为两个新颖的基于互信息的目标:(i) 压缩从预训练 SAM 中提取的域不变关系,尽可能排除伪不变信息,以及 (ii) 最大化教师(预训练 SAM)和学生(微调模型)学习到的关系知识之间的互信息。所提出的 InfoSAM 为 SAM 的 PEFT 建立了一个稳健的蒸馏框架。在多样化基准上的广泛实验验证了 InfoSAM 在提高 SAM 系列在真实世界任务中性能的有效性,证明了其在处理专业场景时的适应性和优越性。

关键词

引用

@article{arxiv.2505.21920,
  title  = {InfoSAM: Fine-Tuning the Segment Anything Model from An Information-Theoretic Perspective},
  author = {Yuanhong Zhang and Muyao Yuan and Weizhan Zhang and Tieliang Gong and Wen Wen and Jiangyong Ying and Weijie Shi},
  journal= {arXiv preprint arXiv:2505.21920},
  year   = {2025}
}

备注

Accepted by ICML 2025 (spotlight)