3D-RCNet:从 Transformer 构建用于高光谱图像分类的 3D 关系卷积网络
计算机视觉与模式识别
2024-08-27 v1
摘要
最近,Vision Transformer(ViT)模型因其卓越的性能在 various computer vision 任务中逐渐取代经典的卷积神经网络(ConvNet)。即便在高光谱图像(HSI)分类领域,ViT 基于的方法也展现出巨大的潜力。然而,ViT 在处理 HSI 数据时面临显著挑战。其自注意力机制具有二次时间复杂度,导致计算成本飙升。此外,ViT 对训练样本的高需求与 HSI 数据昂贵标注的实际限制不符。为克服这些挑战,我们提出一种名为 3D-RCNet 的 3D 关系卷积网络,该网络继承了 ConvNet 和 ViT 的优势,在 HSI 分类任务中实现卓越性能。我们将 Transformer 的自注意力机制嵌入 ConvNet 的卷积运算中,设计出 3D 关系卷积运算,并据此构建最终的 3D-RCNet。所提出的 3D-RCNet 保持了 ConvNet 的高计算效率,同时享受 ViT 的灵活性。此外,所提出的 3D 关系卷积运算是一种即插即用操作,可无缝插入之前基于 ConvNet 的 HSI 分类方法中。在三个具有代表性的 HSI 数据集上的实验结果表明,所提出的模型优于基于 ConvNet 和 ViT 的 HSI 方法。
引用
@article{arxiv.2408.13728,
title = {3D-RCNet: Learning from Transformer to Build a 3D Relational ConvNet for Hyperspectral Image Classification},
author = {Haizhao Jing and Liuwei Wan and Xizhe Xue and Haokui Zhang and Ying Li},
journal= {arXiv preprint arXiv:2408.13728},
year = {2024}
}