RSRefSeg 2:基于基础模型的指代遥感图像分割解耦
计算机视觉与模式识别
2026-03-19 v1
摘要
指代遥感图像分割通过视觉-语言协作解释为遥感场景分析提供了灵活且精细的框架。当前方法主要采用包含双模态编码、跨模态交互和像素解码的三阶段流水线。这些方法在处理复杂语义关系和实现精确跨模态对齐方面存在显著局限,主要由于其耦合处理机制将目标定位与边界 delineation 混为一谈。这种架构耦合在语义模糊下放大了误差传播,同时限制了模型泛化能力和可解释性。为了解决这些问题,我们提出 RSRefSeg 2,一种解耦范式,将传统工作流重构为协作双阶段框架:粗定位后接精细分割。RSRefSeg 2 通过策略性基础模型协作,将 CLIP 的跨模态对齐能力与 SAM 的分割泛化能力相结合。具体而言,CLIP 被用作双模态编码器,在其预对齐的语义空间中激活目标特征并生成定位提示。为缓解 CLIP 在指代文本描述的多实体场景中的误激活问题,设计了一个级联二阶提示器,通过将文本嵌入分解为互补语义子空间进行隐式推理,从而提高精度。这些优化后的语义提示随后引导 SAM 生成像素级精细掩码,从而完成语义传递流水线。大量实验(RefSegRS、RRSIS-D 和 RISBench)表明 RSRefSeg 2 在语义分割精度(+~3% gIoU)和复杂语义解释方面超越了现有方法。代码可在 https://github.com/KyanChen/RSRefSeg2 获取。
引用
@article{arxiv.2507.06231,
title = {RSRefSeg 2: Decoupling Referring Remote Sensing Image Segmentation with Foundation Models},
author = {Keyan Chen and Chenyang Liu and Bowen Chen and Jiafan Zhang and Zhengxia Zou and Zhenwei Shi},
journal= {arXiv preprint arXiv:2507.06231},
year = {2026}
}