中文

HyperSIGMA:面向 hyperspectral 图像的智能理解基础模型

计算机视觉与模式识别 2025-04-02 v2 图像与视频处理

摘要

准确的 hyperspectral 图像 (HSI) 解释对于提供各种地球观察相关应用(如城市规划、精密农业和环境监测)的有价值见解至关重要。然而,现有的 HSI 处理方法主要是任务特定的和场景依赖的,这严重限制了其在不同任务和场景之间传递知识的能力,从而降低了在实际应用中的实用性。为解决这些挑战,我们提出了 HyperSIGMA,一个基于视觉转换器的 foundation model,将 HSI 解释在任务和场景之间统一,可扩展至超过10亿参数。为克服 HSI 中固有的光谱和空间冗余,我们引入一种新颖的稀疏抽样注意 (SSA) 机制,有效促进了多样化语境特征的学习,作为 HyperSIGMA 的基本模块。HyperSIGMA 使用专为设计的光谱增强模块整合空间和光谱特征。此外,我们构建了一个大规模 hyperspectral 数据集,HyperGlobal-450K,用于预训练,其中包含约45万张 hyperspectral 图像,显著超过现有数据集的规模。在各种高层次和低层次 HSI 任务上的大量实验表明,HyperSIGMA 在当前最先进的方法方面具有卓越的表达能力。此外,HyperSIGMA 在可扩展性、鲁棒性、跨模态迁移能力、实际应用性和计算效率方面均显示出显著优势。该代码和模型将在 https://github.com/WHU-Sigma/HyperSIGMA 上发布。

关键词

引用

@article{arxiv.2406.11519,
  title  = {HyperSIGMA: Hyperspectral Intelligence Comprehension Foundation Model},
  author = {Di Wang and Meiqi Hu and Yao Jin and Yuchun Miao and Jiaqi Yang and Yichu Xu and Xiaolei Qin and Jiaqi Ma and Lingyu Sun and Chenxing Li and Chuan Fu and Hongruixuan Chen and Chengxi Han and Naoto Yokoya and Jing Zhang and Minqiang Xu and Lin Liu and Lefei Zhang and Chen Wu and Bo Du and Dacheng Tao and Liangpei Zhang},
  journal= {arXiv preprint arXiv:2406.11519},
  year   = {2025}
}

备注

Accepted by IEEE TPAMI. Project website: https://whu-sigma.github.io/HyperSIGMA