中文

面向多模态和高光谱地理空间数据的可扩展基础模型

计算机视觉与模式识别 2025-03-27 v3 人工智能

摘要

地理空间栅格数据,如由卫星图像系统在不同时间和光谱带收集的数据,具有巨大的潜力,可实现广泛的高影响力应用。这种潜力源于其在多个通道和感知模态中具有空间和时间语境丰富的信息。近期研究已适应现有的自监督学习方法用于此类地理空间数据。然而,它们不足以提供可扩展的模型架构,导致在应对日益增多的通道和模态时缺乏灵活性和计算效率。为解决这些限制,我们提出Low-rank Efficient Spatial-Spectral Vision Transformer,包含三个关键创新:i)用于近似高维空间-光谱注意力的LESS注意力块,通过Kronecker乘积实现低维空间和光谱注意力组件的组合;ii)连续位置-通道嵌入层,保留每个空间-光谱补丁的连续性和物理特性;iii)感知场掩码,通过约束注意力仅聚焦于相邻补丁来利用局部空间依赖性。为评估所提出的创新,我们构建GFM-Bench,作为此类地理空间栅格数据的综合基准。我们使用集成位置和通道掩码策略的高光谱掩码自动编码器框架预训练LESS ViT。实验结果表明,我们的方法在对抗SOTA多模态地理空间基础模型方面表现出竞争力,同时在跨卫星泛化任务中表现更优,计算效率更高。该框架的灵活性和可扩展性为未来涉及广泛模态和通道的地理空间数据分析任务指明了前景。

关键词

引用

@article{arxiv.2503.12843,
  title  = {Towards Scalable Foundation Model for Multi-modal and Hyperspectral Geospatial Data},
  author = {Haozhe Si and Yuxuan Wan and Minh Do and Deepak Vasisht and Han Zhao and Hendrik F. Hamann},
  journal= {arXiv preprint arXiv:2503.12843},
  year   = {2025}
}