中文

面向甚高分辨率遥感图像的傅里叶复域上下文学习

计算机视觉与模式识别 2022-10-31 v1

摘要

甚高分辨率(VHR)遥感(RS)图像分类是遥感图像分析与理解的基础任务。近来,基于Transformer的模型在从通用分辨率(224×224像素)自然图像中学习高阶上下文关系方面展现出卓越潜力,并在通用图像分类任务上取得了显著成果。然而,朴素Transformer的复杂度随图像尺寸呈二次增长,这阻碍了基于Transformer的模型用于VHR遥感图像(500×500像素)分类及其他计算昂贵的下游任务。为此,我们提出通过离散傅里叶变换(DFT)将昂贵的自注意力(SA)分解为实部和虚部,进而提出一种高效的复自注意力(CSA)机制。得益于DFT的共轭对称性质,CSA能够以低于朴素SA一半的计算量建模高阶上下文信息。为克服傅里叶复域中的梯度爆炸,我们用精心设计的Logmax函数替换Softmax函数以归一化CSA的注意力图并稳定梯度传播。通过堆叠多层CSA模块,我们提出傅里叶复Transformer(FCT)模型,以分层方式从VHR航拍图像中学习全局上下文信息。在常用遥感分类数据集上开展的通用实验证明了FCT的有效性与高效性,尤其在甚高分辨率遥感图像上。

关键词

引用

@article{arxiv.2210.15972,
  title  = {Contextual Learning in Fourier Complex Field for VHR Remote Sensing Images},
  author = {Yan Zhang and Xiyuan Gao and Qingyan Duan and Jiaxu Leng and Xiao Pu and Xinbo Gao},
  journal= {arXiv preprint arXiv:2210.15972},
  year   = {2022}
}