用于遥感图像分类的多模态融合Transformer
计算机视觉与模式识别
2023-06-21 v2 机器学习
图像与视频处理
摘要
视觉Transformer(ViTs)在与卷积神经网络(CNNs)相比展现出令人瞩目的性能后,已在图像分类任务中成为趋势。因此,许多研究者尝试将ViTs引入高光谱图像(HSI)分类任务。为取得接近CNNs的满意性能,Transformer所需参数更少。ViTs及其他类似Transformer使用随机初始化且往往泛化不佳的外部分类(CLS)令牌,而光探测与测距(LiDAR)等多模态数据集的其他来源可通过CLS改进这些模型。本文提出一种新的多模态融合Transformer(MFT)网络,其包含用于HSI土地覆盖分类的多头交叉块注意力(mCrossPA)。我们的mCrossPA在Transformer编码器中除HSI外还利用其他互补信息源以实现更好的泛化。令牌化概念用于生成CLS与HSI块令牌,有助于在缩减的层次化特征空间中学习 distinctive representation( distinctive表示)。在广泛使用基准数据集(即休斯顿大学、特伦托、南密西西比大学海湾公园(MUUFL)和奥格斯堡)上进行了大量实验。我们将所提MFT模型与其他SOTA Transformer、经典CNN及传统分类器模型进行比较。所提模型取得的优越性能归功于多头交叉块注意力的使用。源代码将在 \url{https://github.com/AnkurDeria/MFT} 公开。
引用
@article{arxiv.2203.16952,
title = {Multimodal Fusion Transformer for Remote Sensing Image Classification},
author = {Swalpa Kumar Roy and Ankur Deria and Danfeng Hong and Behnood Rasti and Antonio Plaza and Jocelyn Chanussot},
journal= {arXiv preprint arXiv:2203.16952},
year = {2023}
}
备注
Published in IEEE Transactions on Geoscience and Remote Sensing