中文

ViRefSAM:基于视觉参考的遥感分割模型

计算机视觉与模式识别 2025-07-04 v1

摘要

Segment Anything Model(SAM)凭借其基于 prompt 的范式在通用分割任务中表现出强大的泛化能力。然而,将 SAM 应用于遥感(RS)图像仍面临两个主要挑战:其一,手动为每个图像构建精确的 prompt(如点或框)在 RS 场景下耗时且低效,尤其是当 RS 图像包含密集小目标或空间碎片化分布时;其二,SAM 缺乏域适应性,因为其主要在自然图像上预训练,难以捕获 RS 特定的语义和空间特征,尤其是在分割新型或未见类别时。为此,我们受 few-shot 学习的启发,提出一种 novel 框架 ViRefSAM,通过仅利用包含类别特定目标的少数已标注参考图像来指导 SAM 实现分割。无需手动 prompt,ViRefSAM 可实现对包含类一致目标的 RS 图像的自动分割。具体而言,ViRefSAM 在保持 SAM 原有架构的基础上引入两个关键组件:(1)一种视觉语境 Prompt Encoder,从参考图像中提取类别特定语义线索,并通过与目标图像的 contextual interaction 生成 object-aware prompts;(2)一种 Dynamic Target Alignment Adapter 集成到 SAM 的 image encoder 中,通过注入类别特定语义来缓解域间差距,使 SAM 能够动态聚焦于任务相关区域。在三个 few-shot 分割基准(包括 iSAID-5i^i、LoveDA-2i^i 和 COCO-20i^i)上的大量实验表明,ViRefSAM 仅凭借少数参考图像即可实现对未见类别的准确自动分割,并在 diverse 数据集上一致优于现有的 few-shot 分割方法。

关键词

引用

@article{arxiv.2507.02294,
  title  = {ViRefSAM: Visual Reference-Guided Segment Anything Model for Remote Sensing Segmentation},
  author = {Hanbo Bi and Yulong Xu and Ya Li and Yongqiang Mao and Boyuan Tong and Chongyang Li and Chunbo Lang and Wenhui Diao and Hongqi Wang and Yingchao Feng and Xian Sun},
  journal= {arXiv preprint arXiv:2507.02294},
  year   = {2025}
}