中文

HyperVision:面向地面超光谱视觉的通道自适应预训练主干网络

计算机视觉与模式识别 2026-05-29 v2

摘要

虽然超光谱成像提供跨数百个窄波长波段的丰富空间-光谱信息,可实现精确材料识别,但地面超光谱预训练主干网络缺失,这受制于传感器的不同光谱配置、标签稀缺且不一致,以及现有数据集的规模有限和场景多样性不足。为解决这些挑战并实现通用感知,我们提出了 HyperVision,即第一个地面超光谱预训练主干网络。首先,为处理不同光谱配置,HyperVision 采用基于通道的动态嵌入机制,将异构输入映射到统一的 token 空间。其次,我们开发了无监督表示学习框架。具体而言,为解决标签稀缺和不一致问题,引入了多来源伪标签方法,用于融合来自 SAM2 的空间结构和来自 HyperFree 的细粒度光谱材料信息。此外,为丰富场景多样性并弥补数据集规模有限,利用预训练 RGB 视觉模型中的丰富语义表示进行跨模态知识蒸馏。HyperVision 基于来自 26 个 diverse 地面数据集的 15000 张图像进行预训练,展现出卓越的泛化能力。仅需高效的头部分支适配,不需调整主干参数,即可在三项下游任务中实现与任务特定方法相比的 state-of-the-art 性能,分别在不同传感器配置下,超光谱语义分割 AccM\mathrm{Acc}_{\mathrm{M}} 提升最高可达 16.3%,目标跟踪 AUC 提升 2.1%,显著物体检测 MAE 降低 35.5%。该项目的源码和预训练模型将公开发布于 https://github.com/lronkitty/HyperVision。

关键词

引用

@article{arxiv.2605.17286,
  title  = {HyperVision: A Channel-Adaptive Ground-Based Hyperspectral Vision Pre-trained Backbone},
  author = {Guanyiman Fu and Jingtao Li and Zihang Cheng and Zhuanfeng Li and Diqi Chen and Yan Xu and Xiangyu Liu and Fengchao Xiong and Jianfeng Lu and Chengrong Chen and Jun Zhou},
  journal= {arXiv preprint arXiv:2605.17286},
  year   = {2026}
}