中文

SkySense:面向地球观测影像通用解译的多模态遥感基础模型

计算机视觉与模式识别 2024-03-25 v2

摘要

先前关于遥感基础模型(RSFM)的研究揭示了构建地球观测通用模型的巨大潜力。然而,这些工作主要关注单一模态,缺乏时间和地理上下文建模,限制了它们处理多样化任务的能力。在本研究中,我们提出了SkySense,一个通用的十亿级模型,在精心整理的多模态遥感影像(RSI)数据集上进行了预训练,该数据集包含2150万条时间序列。SkySense采用分解式多模态时空编码器,以光学和合成孔径雷达(SAR)数据的时间序列作为输入。该编码器通过我们提出的多粒度对比学习进行预训练,以学习跨不同模态和空间粒度的表示。为了进一步利用地理上下文线索增强RSI表示,我们引入了地理上下文原型学习,在RSI的多模态时空特征上学习区域感知原型。据我们所知,SkySense是迄今为止最大的多模态RSFM,其模块可以灵活组合或单独使用以适应各种任务。在涵盖7个任务、16个数据集的全面评估中,SkySense展现了卓越的泛化能力,任务范围从单模态到多模态、静态到时序、分类到定位。SkySense在所有测试场景中均优于18个最新的RSFM。具体而言,它大幅超越了GFM、SatLas和Scale-MAE等最新模型,平均分别高出2.76%、3.67%和3.61%。我们将发布预训练权重,以促进未来研究和地球观测应用。

关键词

引用

@article{arxiv.2312.10115,
  title  = {SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery},
  author = {Xin Guo and Jiangwei Lao and Bo Dang and Yingying Zhang and Lei Yu and Lixiang Ru and Liheng Zhong and Ziyuan Huang and Kang Wu and Dingxiang Hu and Huimei He and Jian Wang and Jingdong Chen and Ming Yang and Yongjun Zhang and Yansheng Li},
  journal= {arXiv preprint arXiv:2312.10115},
  year   = {2024}
}

备注

Accepted by CVPR2024