重新思考用于多光谱卫星影像的 Transformer 预训练
计算机视觉与模式识别
2024-03-11 v1
摘要
无监督学习的最新进展表明,大型视觉模型能够通过在海量的无标签数据上进行预训练,在下行任务中取得令人瞩目的结果。由于大量无标签数据的可用性,这种预训练技术最近也在遥感领域得到了探索。与标准的自然图像数据集不同,遥感数据是从各种传感器技术获取的,并表现出多样的尺度变化和模态。现有的卫星图像预训练方法要么忽略了遥感影像中存在的尺度信息,要么局限于仅使用单一类型的数据模态。在本文中,我们重新审视了 Transformer 预训练,并利用多尺度信息,将其与多种模态有效结合。我们提出的方法名为 SatMAE++,执行多尺度预训练,并利用基于卷积的上采样块在更高尺度上重建图像,使其可扩展以包含更多尺度。与现有工作相比,具有多尺度预训练的 SatMAE++ 对光学影像和多光谱影像同样有效。在六个数据集上的广泛实验揭示了所提出贡献的优点,在所有数据集上均实现了最先进(SOTA)的性能。SatMAE++ 在 BigEarthNet 数据集的多标签分类任务中实现了平均精度均值(mAP)2.5\% 的提升。我们的代码和预训练模型可在 \url{https://github.com/techmn/satmae_pp} 获取。
引用
@article{arxiv.2403.05419,
title = {Rethinking Transformers Pre-training for Multi-Spectral Satellite Imagery},
author = {Mubashir Noman and Muzammal Naseer and Hisham Cholakkal and Rao Muhammad Anwar and Salman Khan and Fahad Shahbaz Khan},
journal= {arXiv preprint arXiv:2403.05419},
year = {2024}
}
备注
Accepted at CVPR 2024