FarSLIP:发现有效 CLIP 适配以实现精细遥感理解
摘要
由于 CLIP 的全局对齐限制其捕捉细粒度细节的能力,近期研究聚焦于增强其 region-text 对齐。然而,当前遥感 (RS) 专用 CLIP 变体仍继承此有限空间感知能力。我们识别了这一问题的两个关键限制:(1) 当前 RS 图像文本数据集从 object-level 标签生成 global caption,导致原有的 object-level 监督未被充分利用;(2) 尽管 region-text 对齐方法在通用领域取得成功,但直接应用于 RS 数据常导致性能下降。为此,我们构建了首个多粒度 RS 图像文本数据集 MGRS-200k, featuring rich object-level 文本监督用于 RS region-category 对齐。我们进一步探讨现有的细粒度 CLIP 调优策略,发现当前显式 region-text 对齐方法(无论是直接还是间接方式)均因 CLIP 语义一致性严重退化而表现不佳。基于此,我们提出 FarSLIP,一个面向遥感领域的 Fine-grained Aligned RS Language-Image Pretraining 框架。与常用的 patch-to-CLS 自蒸馏不同,FarSLIP 采用 patch-to-patch 蒸馏以对齐局部和全局视觉线索,提高特征判别性同时保持语义一致性。此外,为有效利用 region-text 监督,FarSLIP 采用简单 CLS token 基于 region-category 对齐而非显式 patch 级对齐,进一步提升空间感知能力。FarSLIP 在 RS 领域实现细粒度视觉语言对齐,仅在 RS 开放词汇语义分割上,更在图像级任务(如零样本分类和图像文本检索)上均达到新纪录。我们的 dataset、code 和 models 均可在 https://github.com/NJU-LHRS/FarSLIP 获取。
引用
@article{arxiv.2511.14901,
title = {FarSLIP: Discovering Effective CLIP Adaptation for Fine-Grained Remote Sensing Understanding},
author = {Zhenshi Li and Weikang Yu and Dilxat Muhtar and Xueliang Zhang and Pengfeng Xiao and Pedram Ghamisi and Xiao Xiang Zhu},
journal= {arXiv preprint arXiv:2511.14901},
year = {2025}
}