面向遥感自监督学习的模式集成与增强视觉Transformer
计算机视觉与模式识别
2024-11-12 v1
摘要
最近的自监督学习方法在从未标记的遥感图像中学习视觉表示方面取得了令人印象深刻的结果。然而,大多数遥感图像主要由包含多个地物且没有明确前景目标的全景场景组成,这限制了现有专注于前景目标的自监督方法的性能。这引发了一个问题:是否存在一种方法可以自动聚合全景遥感图像中的相似物体,从而使模型能够区分嵌入在各种地理空间模式中的知识,以改进特征表示?在这项工作中,我们提出了模式集成与增强视觉Transformer(PIEViT),这是一种专门为遥感图像设计的新型自监督学习框架。PIEViT利用教师-学生架构来处理图像级和块级任务。它采用地理空间模式内聚(GPC)模块来探索块的自然聚类,增强单个特征的区分度。特征集成投影(FIP)模块进一步利用地理空间聚类的块来细化掩码token重建。我们在多个下游任务上验证了PIEViT,包括目标检测、语义分割和变化检测。实验表明,PIEViT增强了内部块特征的表示,比现有的自监督基线有显著改进。它在目标检测、土地覆盖分类和变化检测方面取得了优异的结果,突显了其在遥感图像解译任务中的鲁棒性、泛化性和可迁移性。
引用
@article{arxiv.2411.06091,
title = {Pattern Integration and Enhancement Vision Transformer for Self-Supervised Learning in Remote Sensing},
author = {Kaixuan Lu and Ruiqian Zhang and Xiao Huang and Yuxing Xie and Xiaogang Ning and Hanchao Zhang and Mengke Yuan and Pan Zhang and Tao Wang and Tongkui Liao},
journal= {arXiv preprint arXiv:2411.06091},
year = {2024}
}