中文

无标注遥感图像开放词汇分段

计算机视觉与模式识别 2025-08-26 v1

摘要

遥感(RS)图像语义分段是全面地球观察的关键,但对解释新目标类别的需求,加上手动标注的高昂成本,带来了显著挑战。虽然开放词汇语义分段(OVSS)提供了有前景的解决方案,但现有框架为自然图像设计,难以适应RS数据的独特复杂性。它们在处理大尺度变化和细粒度细节方面困难,适应性常依赖大量昂贵的标注。为此,本文引入SegEarth-OV,首个针对RS图像实现无标注开放词汇分段的框架。具体而言,我们提出SimFeatUp,一种通用升采样器,能从粗糙特征中稳健恢复高分辨率空间细节,无需任何任务特定的后训练即可纠正目标形状的失真。我们还提出一种简单而有效的全局偏好缓解操作,以从 patch 特征中减去固有的全局上下文,显著提升局部语义保真度。这些组件使SegEarth-OV能够有效利用预训练视觉语言模型(VLM)的丰富语义,实现RS场景中的OVSS。进一步地,为拓展框架对其他具有挑战性RS模态(如SAR图像)的通用性,我们引入AlignEarth,这是一种基于蒸馏的策略,能将光学VLM编码器的语义知识高效地传递给SAR编码器,无需从零构建SAR基础模型即可实现跨多种传感器类型的通用OVSS。大量实验表明,SegEarth-OV在光学和SAR数据集上均显著优于SOTA方法,为无标注和开放世界的地球观察奠定了稳健基础。

关键词

引用

@article{arxiv.2508.18067,
  title  = {Annotation-Free Open-Vocabulary Segmentation for Remote-Sensing Images},
  author = {Kaiyu Li and Xiangyong Cao and Ruixun Liu and Shihong Wang and Zixuan Jiang and Zhi Wang and Deyu Meng},
  journal= {arXiv preprint arXiv:2508.18067},
  year   = {2025}
}

备注

All codes and models will be released at https://github.com/earth-insights/SegEarth-OV-2