中文

TimeSenCLIP:用于遥感的时序视觉语言模型

计算机视觉与模式识别 2026-04-01 v3

摘要

视觉语言模型(VLM)在遥感应用中展现出巨大的潜力,尤其是通过零样本分类和检索实现土地利用和土地覆盖(LULC)映射。然而,当前方法面临诸多挑战,如依赖caption式监督,这类监督信息在覆盖语义方面往往不可得或有限;且从通用 VLM 架构迁移,适用于非常高分辨率图像,从而倾向于优先考虑空间上下文而非光谱和时序信息,限制了其处理中等分辨率遥感图像的效果。本文提出了 TimeSenCLIP,一个用于遥感时序数据的轻量级 VLM,采用跨视图时序对比框架,将多光谱 Sentinel-2 时序数据与带地理标签的地面级图像对齐,无需文本注释。与先前 VLM 不同,TimeSenCLIP 强调时序和光谱信号而非空间上下文,探讨单像素时序数据是否包含解决多种任务所需的足够信息。

关键词

引用

@article{arxiv.2508.11919,
  title  = {TimeSenCLIP: A Time Series Vision-Language Model for Remote Sensing},
  author = {Pallavi Jain and Diego Marcos and Dino Ienco and Roberto Interdonato and Tristan Berchoux},
  journal= {arXiv preprint arXiv:2508.11919},
  year   = {2026}
}

备注

Accepted (ISPRS Journal of Photogrammetry and Remote Sensing)