多视图 Transformer:重新思考高光谱图像分类中的空间信息
计算机视觉与模式识别
2023-10-12 v1 人工智能
摘要
识别高光谱图像(HSI)中每个像素的地物类别依赖于光谱与空间信息。具有特定补丁尺寸的 HSI 立方体被用于提取中心像素的空间-光谱特征表示。本文中,我们研究发现 HSI 立方体中可能记录有场景特定但非本质的关联。这些额外信息提升了模型在现有 HSI 数据集上的表现,却使模型能力难以被恰当评估。我们将此问题称为空间过拟合问题,并采用严格实验设置以避免之。我们进一步提出一种用于 HSI 分类的多视图 Transformer,其由多视图主成分分析(MPCA)、光谱编码器-解码器(SED)与空间池化令牌化 Transformer(SPTT)组成。MPCA 通过构建光谱多视图观测并对各视图数据应用 PCA 来提取低维视图表示,从而实现 HSI 降维。视图表示的组合称为多视图表示,是 MPCA 的降维输出。为聚合多视图信息,引入具有光谱维度 U 形的全卷积 SED 以提取多视图特征图。SPTT 使用空间池化令牌化策略将多视图特征转换为令牌,并学习用于地物识别的鲁棒且具判别力的空间-光谱特征。分类由线性分类器完成。在三个 HSI 数据集上采用严格设置的实验表明了所提多视图 Transformer 相对于最先进方法的优越性。
引用
@article{arxiv.2310.07186,
title = {Multiview Transformer: Rethinking Spatial Information in Hyperspectral Image Classification},
author = {Jie Zhang and Yongshan Zhang and Yicong Zhou},
journal= {arXiv preprint arXiv:2310.07186},
year = {2023}
}