MMFormer:基于多尺度自注意力的多模态 Transformer 用于遥感图像分类
计算机视觉与模式识别
2023-03-24 v1
摘要
为利用异构数据间的互补信息,我们引入了一种新的多模态 Transformer(MMFormer)用于遥感(RS)图像分类,使用高光谱图像(HSI)伴随另一数据源如激光探测与测距(LiDAR)。相较于缺乏卷积归纳偏置的传统 Vision Transformer(ViT),我们首先将卷积层引入 MMFormer,以从 HSI 和 LiDAR 的多模态数据中分块令牌化。随后我们提出多尺度多头自注意力(MSMHSA)模块,以解决常限制于融合高光谱分辨率的 HSI 与相对较低空间分辨率的 LiDAR 的兼容性问题。所提 MSMHSA 模块能以由粗到细的方式将 HSI 融入 LiDAR 数据,使我们能够学习细粒度表示。在广泛使用的数据集(如 Trento 和 MUUFL)上的大量实验证明了我们所提 MMFormer 在遥感图像分类上的有效性与优越性。
引用
@article{arxiv.2303.13101,
title = {MMFormer: Multimodal Transformer Using Multiscale Self-Attention for Remote Sensing Image Classification},
author = {Bo Zhang and Zuheng Ming and Wei Feng and Yaqian Liu and Liang He and Kaixing Zhao},
journal= {arXiv preprint arXiv:2303.13101},
year = {2023}
}