FOCUS:基于融合通道观测解构光谱
计算机视觉与模式识别
2026-04-28 v2 人工智能
摘要
hyperspectral 成像(HSI)捕获数百个狭窄且连续的波段,是生物学、农业和环境监测中强大的工具。然而,针对该场景的 Vision Transformer(ViT)解释研究仍鲜有探索,主要源于两个挑战:(1)现有显著性方法难以捕获有意义的光谱线索,常将注意力压缩至 class token;(2)全谱 ViT 因 HSI 数据的高维特性,在解释性计算上昂贵。我们提出 FOCUS,首个实现冻结 ViT 可靠且高效时空解释框架。FOCUS 引入两核心组件:引导注意力聚焦于语义意义的波段组合的 class-specific 光谱提示,以及通过吸引损失训练的可学习 [SINK] token 以吸收噪声或冗余注意力。这些设计使单次前向传播即可生成稳定可解释的 3D 显著性图和光谱重要性曲线,无需梯度反向传播或修改 backbone。FOCUS 将 band-level IoU 提升 15%,将注意力压缩降低 40%以上,并产生与专家标注高度一致的显著性结果。仅用 <1% 参数开销,使高分辨率 ViT 解释在实际 hyperspectral 应用中实用,弥补黑箱建模与可信 HSI 决策之间长期的鸿沟。
引用
@article{arxiv.2507.14787,
title = {FOCUS: Fused Observation of Channels for Unveiling Spectra},
author = {Xi Xiao and Aristeidis Tsaris and Anika Tabassum and John Lagergren and Larry M. York and Tianyang Wang and Xiao Wang},
journal= {arXiv preprint arXiv:2507.14787},
year = {2026}
}
备注
ICME 2026