SPEX:用于光谱遥感图像栅格化遮挡的视觉-语言模型
计算机视觉与模式识别
2026-03-10 v2
摘要
光谱信息长期以来被认识为遥感观测中关键线索。尽管已developed众多用于像素级解释的视觉-语言模型,但光谱信息仍未被充分利用,导致性能不佳,尤其是在多光谱场景中。为此,我们构建了一个名为 SPIE 的视觉-语言指令遵循数据集,将地覆盖对象的光谱先验编码为大型语言模型 (LLM) 可识别的文本属性,基于经典光谱指数计算。基于该数据集,我们提出SPEX,一个用于指令驱动栅格化遮挡的多模态 LLM。为此,我们引入若干精心设计的组件和训练策略,包括多尺度特征聚合、token 上下文压缩和多光谱视觉预训练,以实现精确且灵活的像素级解释。据此,SPEX 是已知第一个专为光谱遥感图像栅格化遮挡设计的多模态视觉-语言模型。广泛的实验表明,在五个公开的多光谱数据集上,SPEX 在提取如植被、建筑物和水体等典型地覆盖类别时始终优于现有的SOTA方法。此外,SPEX能够为其预测生成文本解释,从而增强可解释性和用户友好性。代码将在 https://github.com/MiliLab/SPEX 发布。
引用
@article{arxiv.2508.05202,
title = {SPEX: A Vision-Language Model for Land Cover Extraction on Spectral Remote Sensing Images},
author = {Dongchen Si and Di Wang and Erzhong Gao and Xiaolei Qin and Liu Zhao and Jing Zhang and Minqiang Xu and Jianbo Zhan and Jianshe Wang and Lin Liu and Bo Du and Liangpei Zhang},
journal= {arXiv preprint arXiv:2508.05202},
year = {2026}
}
备注
Accepted to IEEE TGRS