中文

FUSAR-KLIP:面向遥感多模态基础模型

计算机视觉与模式识别 2026-01-26 v4

摘要

跨模态人工智能,如视觉语言模型,已在一般图像理解中取得显著成功。然而,一般视觉表征与遥感图像解释之间存在根本的认知不一致:遥感图像融合了地形、地势和空间结构,本质上要求模型具备深入的地球科学理解。这种认知差异在合成孔径雷达(SAR)图像中进一步放大:尽管 SAR 拥有不可替代的全天候、全日观测能力,但受限于相干成像机制,呈现出与一般图像的显著模态异质性。为解决这一不一致性,本文提出 FUSAR-KLIP,即首个面向 SAR 的知识引导式通用多模态基础模型,以及可复用的数据和评估基线。具体而言:(1) 构建了 FUSAR-GEOVL-1M(首个规模为 100 万+ SAR 数据集,包含完整地理投影属性),覆盖多个卫星平台,涵盖 12 万幅图像和 135 个城市;(2) 通过层次化认知思维链生成对齐的结构化文本,准确编码了来自地形学环境、区域属性到空间关系的 100 万+ 多维语义信息;(3) 设计了自一致的迭代优化机制,在由对比、匹配和重建组成的自监督闭环中,以符合人类认知和物理法则的知识信息指导跨模态学习;(4) 在视觉和语言两个主要类别下的 11 个典型下游任务中建立了统一评估基准,并与 15 种主流基础模型进行比较。

关键词

引用

@article{arxiv.2509.23927,
  title  = {FUSAR-KLIP: Towards Multimodal Foundation Models for Remote Sensing},
  author = {Yi Yang and Xiaokun Zhang and Qingchen Fang and Jing Liu and Ziqi Ye and Rui Li and Li Liu and Haipeng Wang},
  journal= {arXiv preprint arXiv:2509.23927},
  year   = {2026}
}