中文

SenCLIP:利用地面提示增强 Sentinel-2 零样本土地利用映射

计算机视觉与模式识别 2025-08-18 v1

摘要

预训练的视觉语言模型(如 CLIP)在零样本分类任务中展现出强大的使用自由形式提示的能力,甚至在特定领域展现一定的泛化能力。然而,由于其训练数据中却存在地面图像的样本不足,导致其在卫星影像上的性能受限。现有的卫星图像提示技术常局限于通用短语(如“一幅卫星图像...”),限制了其在零样本土地利用和土地覆盖(LULC)映射中的有效性。为此,我们提出了 SenCLIP,通过利用来自全欧洲的大量 Sentinel-2 影像与带地理位置标记的地面照片配对数据,实现了 CLIP 表示对 Sentinel-2 影像的迁移。我们在使用 EuroSAT 和 BigEarthNet 数据集进行零样本 LULC 映射任务评估时,采用了空中和地面提示样式。我们的做法通过将地面表示与卫星影像对齐,在两种提示样式下均显著提升了分类准确率,为在零样本 LULC 映射中应用自由形式文本描述开辟了新的可能性。

关键词

引用

@article{arxiv.2412.08536,
  title  = {SenCLIP: Enhancing zero-shot land-use mapping for Sentinel-2 with ground-level prompting},
  author = {Pallavi Jain and Dino Ienco and Roberto Interdonato and Tristan Berchoux and Diego Marcos},
  journal= {arXiv preprint arXiv:2412.08536},
  year   = {2025}
}

备注

Accepted at WACV'25