中文

面向遥感图像的双模态文本提示学习

计算机视觉与模式识别 2026-01-29 v1

摘要

提示学习 (PL) 已成为在监督信息有限的情况下适应面向视觉-语言模型 (VLM) 的有效策略,如 CLIP。尽管 PL 在自然图像数据集上显示出强大的泛化能力,但其向遥感 (RS) 图像的可迁移性仍未得到充分探索。RS 数据呈现出独特挑战,包括多标签场景、较高的类内变异性以及多样的空间分辨率,这些因素阻碍了现有 PL 方法的直接应用。特别是,当前基于提示的方法往往难以识别dominant语义线索,无法泛化到 RS 场景中的新类别。为解决这些挑战,我们提出了 BiMoRS,一个为 RS 任务量身定制的轻量级双模态提示学习框架。BiMoRS 使用冻结的图像描述模型(如 BLIP-2)从 RS 图像中提取文本语义摘要。这些描述通过 BERT 分词器进行标记化,并与 CLIP 编码器提取的高级视觉特征融合。随后,一个轻量级的跨注意力模块在融合后的文本-视觉表示上条件化可学习的查询提示,从而生成无需修改 CLIP 主干网络的上下文感知提示。我们在四个 RS 数据集上的三个领域泛化 (DG) 任务上进行评估,结果显示该方法 consistently 取得性能提升,平均超过强基准方法 2%。代码已公开于 https://github.com/ipankhi/BiMoRS。

关键词

引用

@article{arxiv.2601.20675,
  title  = {bi-modal textual prompt learning for vision-language models in remote sensing},
  author = {Pankhi Kashyap and Mainak Singha and Biplab Banerjee},
  journal= {arXiv preprint arXiv:2601.20675},
  year   = {2026}
}

备注

Accepted in ICASSP 2026