LESSViT:光谱配置偏移下的鲁棒高光谱表示学习
计算机视觉与模式识别
2026-05-19 v1
摘要
由于波长覆盖、波段采样和通道维度的变化,跨不同传感器对高光谱图像(HSI)进行建模是一项基本挑战。因此,在固定光谱配置下训练的模型往往难以泛化到其他传感器。现有的 Vision Transformer (ViT) 方法要么依赖于具有固定通道假设的隐式光谱建模,要么采用计算成本高昂的显式空间-光谱注意力,导致效率与表达能力之间存在根本性的权衡。在本工作中,我们引入了低秩高效空间-光谱 ViT(LESSViT),一种用于跨光谱泛化的传感器灵活架构。LESSViT 建立在 LESS Attention 之上,这是一种结构化低秩分解,通过可分离的空间和光谱分量来建模联合空间-光谱交互,将全空间-光谱注意力的复杂度从 降低到 ,其中 是空间 token 数量, 是光谱通道数量, 是低秩近似的秩。我们进一步结合了通道无关的 patch 嵌入和波长感知位置编码,以支持灵活的光谱输入。为了实现高效且鲁棒的预训练,我们引入了具有解耦空间-光谱掩码和分层通道采样的高光谱掩码自编码器(HyperMAE)。我们在模拟跨传感器变异性的跨光谱泛化设置下评估了 LESSViT。在 SpectralEarth 基准上的实验表明,LESSViT 在光谱偏移下提高了鲁棒性,同时在分布内保持竞争力,并且显式且高效的空间-光谱建模对于可扩展和可泛化的高光谱表示学习至关重要。
引用
@article{arxiv.2605.18541,
title = {LESSViT: Robust Hyperspectral Representation Learning under Spectral Configuration Shift},
author = {Haozhe Si and Yuxuan Wan and Yuqing Wang and Minh Do and Han Zhao},
journal= {arXiv preprint arXiv:2605.18541},
year = {2026}
}