中文

面向 Segment Anything Model 适应的持续学习

计算机视觉与模式识别 2024-12-18 v2

摘要

尽管当前各种 SAM 适应方法(如基于提示的和基于适配器的)在各种下游任务中取得了令人期待的性能,但大多数属于单步适应范式。在实际场景中,我们通常面临数据以流式方式呈现的动态情形。鉴于实际需求,本文首先提出一种新的持续 SAM 适应 (CoSAM) 框架,包含 8 个不同的任务域,并仔细分析现有 SAM 单步适应方法在持续分割场景中的局限性。随后,我们提出一种新颖的简单而有效的混合域适配器 (MoDA) 算法,利用全局特征令牌 (GFT) 和全局助理令牌 (GAT) 模块,帮助 SAM 编码器提取不同任务域的良好分离特征,再为持续学习提供准确的任务特定信息。大量实验表明,我们的 MoDA 在持续分割任务中显著优于现有的经典持续学习方法,以及基于提示和基于适配器的方法。此外,在多样化数据分布下顺序学习 CoSAM 框架后,我们的 MoDA 在自然图像领域仍保持高度具竞争力,接近原始 SAM 的零射出性能,展示了其在知识保留方面的优越能力。值得注意的是,所提出的 MoDA 可无缝集成到各种 SAM 的单步适应方法中,始终带来显著的性能提升。代码已公开于 \url{https://github.com/yangjl1215/CoSAM}。

关键词

引用

@article{arxiv.2412.06418,
  title  = {Continual Learning for Segment Anything Model Adaptation},
  author = {Jinglong Yang and Yichen Wu and Jun Cen and Wenjian Huang and Hong Wang and Jianguo Zhang},
  journal= {arXiv preprint arXiv:2412.06418},
  year   = {2024}
}

备注

Code is available at \url{https://github.com/yangjl1215/CoSAM}