DGL-RSIS:解耦全局空间上下文与局部类别语义以实现免训练遥感图像分割
计算机视觉与模式识别
2025-11-12 v2
摘要
视觉语言模型(VLMs)的出现弥合了视觉与语言之间的差距,使多模态理解超越了传统的纯视觉深度学习模型。然而,将 VLMs 从自然图像领域迁移到遥感(RS)分割仍然具有挑战性,这是由于领域差距大以及 RS 输入在不同任务中的多样性,特别是在开词汇语义分割(OVSS)和指代表达分割(RES)方面。在这里,我们提出了一种免训练的统一框架 DGL-RSIS,它将视觉和文本表示解耦,并在局部语义和全局上下文两个层面实现视觉-语言对齐。具体而言,全局-局部解耦(GLD)模块将文本输入解耦为局部语义标记和全局上下文标记,同时将图像输入划分为类别无关的掩码提议。然后,局部视觉-文本对齐(LVTA)模块自适应地从掩码提议中提取上下文感知的视觉特征,并通过知识引导的提示工程丰富文本特征,从而从局部视角实现 OVSS。此外,全局视觉-文本对齐(GVTA)模块采用全局增强的 Grad-CAM 机制来捕获指代表达的上下文线索,随后一个掩码选择模块将像素级激活整合到掩码级分割输出中,从而从全局视角实现 RES。在 iSAID(OVSS)和 RRSIS-D(RES)基准测试上的实验表明,DGL-RSIS 优于现有的免训练方法。消融研究进一步验证了每个模块的有效性。据我们所知,这是第一个用于 RS 图像分割的统一免训练框架,能够有效地将训练于自然图像的 VLMs 的语义能力迁移到 RS 领域,而无需额外训练。
引用
@article{arxiv.2509.00598,
title = {DGL-RSIS: Decoupling Global Spatial Context and Local Class Semantics for Training-Free Remote Sensing Image Segmentation},
author = {Boyi Li and Ce Zhang and Richard M. Timmerman and Wenxuan Bao},
journal= {arXiv preprint arXiv:2509.00598},
year = {2025}
}