中文

基于 CLIP 与提示学习的少样本遥感图像场景分类

计算机视觉与模式识别 2025-10-29 v1 人工智能

摘要

遥感应用越来越依赖深度学习进行场景分类。然而,由于在多样化的地理和传感器领域缺乏标记数据和标注成本高,性能常常受到限制。虽然最近的视觉语言模型如 CLIP 通过对齐视觉和文本模态在大规模数据上学习可迁移的表征,显示出前景,但其直接应用于遥感领域仍不够理想,主要due to显著的领域差距以及需要特定任务的语义适应。为此,我们系统地探索了提示学习作为一种轻量且高效的适应策略,用于少样本遥感图像场景分类。我们评估了几种代表性的方法,包括情境优化、条件情境优化、多模态提示学习以及结合自调节约束的提示学习。这些方法反映了不同的设计哲学:从静态情境优化到条件提示以增强泛化,到多模态提示进行联合视觉-语言适应,以及语义正则化提示实现稳定的学习而不忘记。我们将这些提示学习方法与两个标准基线进行基准测试:基于手工提示的零样本 CLIP 和在冻结 CLIP 特征上训练的线性探针。通过在多个基准遥感数据集上的大量实验,包括跨数据集的泛化测试,我们证明了提示学习在少样本情景下始终优于两者。值得注意的是,结合自调节约束的提示学习实现了最robust的跨域性能。我们的发现表明,提示学习是一种可扩展且高效的解决方案,用于弥合卫星和航空图像之间的领域差距,为该领域的未来研究提供了坚实的基础。

关键词

引用

@article{arxiv.2510.24321,
  title  = {Few-Shot Remote Sensing Image Scene Classification with CLIP and Prompt Learning},
  author = {Ivica Dimitrovski and Vlatko Spasev and Ivan Kitanovski},
  journal= {arXiv preprint arXiv:2510.24321},
  year   = {2025}
}