中文

提升 Segment Anything Model 以适应视觉非显著场景

计算机视觉与模式识别 2026-01-05 v1

摘要

Segment Anything Model (SAM) 以其卓越的零样分割能力而备受关注,但在处理我们称之为视觉非显著场景时,其性能受到挑战。在这些情况下,现有方法无法捕获准确的轮廓,无法产生有前景的分割结果。本文提出了视觉非显著 SAM (Visually Non-Salient SAM, VNS-SAM),旨在在保持原有零样通用性的同时,增强 SAM 对视觉非显著场景的感知能力。我们通过有效利用 SAM 的低级特征,提出两种设计:Mask-Edge Token 交互式解码器和非显著特征挖掘模块。这些设计仅需轻微增加参数和计算要求,即可使 SAM 解码器更深入地理解非显著特征。VNS-SAM 的额外参数可在 4 小时内优化,表明其可行性和实用性。就数据而言,我们建立了 VNS-SEG,一个涵盖各种 VNS 场景的统一数据集,包含超过 35K 张图片,与以往单任务适应方法相比更全面。该数据集旨在使模型学习更稳健的 VNS 特征,并全面评估模型在 VNS 场景下的分割性能和通用性。广泛的实验表明,VNS-SAM 在各种 VNS 分割任务中表现优异,尤其在零样设置下,凸显了其在广泛实际应用中的潜力。代码和数据集已公开 disponible at https://guangqian-guo.github.io/VNS-SAM。

关键词

引用

@article{arxiv.2601.00537,
  title  = {Boosting Segment Anything Model to Generalize Visually Non-Salient Scenarios},
  author = {Guangqian Guo and Pengfei Chen and Yong Guo and Huafeng Chen and Boqiang Zhang and Shan Gao},
  journal= {arXiv preprint arXiv:2601.00537},
  year   = {2026}
}

备注

Accepted by IEEE TIP