面向遥感图文检索的带关键词引导的多视角子图像 CLIP
计算机视觉与模式识别
2026-01-27 v1
摘要
诸如 CLIP 之类的视觉语言预训练模型显著推进了遥感图文检索。然而,现有方法主要依赖粗粒度的全局对齐,往往忽略了遥感影像中固有的稠密、多尺度语义。此外,通过全量微调来适配这些庞大模型会产生高昂的计算成本,并面临灾难性遗忘的风险。为应对这些挑战,我们提出了 MPS-CLIP,这是一个参数高效的框架,旨在将检索范式从全局匹配转变为关键词引导的细粒度对齐。具体而言,我们利用大语言模型提取核心语义关键词,引导 Segment Anything Model (SamGeo) 生成语义相关的子视角。为高效适配冻结的主干网络,我们引入了门控全局注意力 () 适配器,以极小的开销捕获全局上下文与长程依赖。此外,多视角表示模块将这些局部线索聚合为鲁棒的多视角嵌入。该框架通过结合多视角对比损失与加权三元组损失的混合目标函数进行优化,该函数动态选择最大响应视角以抑制噪声并强制精确的语义匹配。在 RSICD 和 RSITMD 基准上的大量实验表明,MPS-CLIP 分别取得了 35.18% 和 48.40% 的平均 Recall (mR),达到了 SOTA 性能,显著优于全量微调基线及近期具竞争力的方法。代码可在 https://github.com/Lcrucial1f/MPS-CLIP 获取。
引用
@article{arxiv.2601.18190,
title = {Multi-Perspective Subimage CLIP with Keyword Guidance for Remote Sensing Image-Text Retrieval},
author = {Yifan Li and Shiying Wang and Jianqiang Huang},
journal= {arXiv preprint arXiv:2601.18190},
year = {2026}
}
备注
7 pages, 3 figures. Code: https://github.com/Lcrucial1f/MPS-CLIP