中文

重新思考用于多光谱卫星影像的 Transformer 预训练

计算机视觉与模式识别 2024-03-11 v1

摘要

无监督学习的最新进展表明,大型视觉模型能够通过在海量的无标签数据上进行预训练,在下行任务中取得令人瞩目的结果。由于大量无标签数据的可用性,这种预训练技术最近也在遥感领域得到了探索。与标准的自然图像数据集不同,遥感数据是从各种传感器技术获取的,并表现出多样的尺度变化和模态。现有的卫星图像预训练方法要么忽略了遥感影像中存在的尺度信息,要么局限于仅使用单一类型的数据模态。在本文中,我们重新审视了 Transformer 预训练,并利用多尺度信息,将其与多种模态有效结合。我们提出的方法名为 SatMAE++,执行多尺度预训练,并利用基于卷积的上采样块在更高尺度上重建图像,使其可扩展以包含更多尺度。与现有工作相比,具有多尺度预训练的 SatMAE++ 对光学影像和多光谱影像同样有效。在六个数据集上的广泛实验揭示了所提出贡献的优点,在所有数据集上均实现了最先进(SOTA)的性能。SatMAE++ 在 BigEarthNet 数据集的多标签分类任务中实现了平均精度均值(mAP)2.5\% 的提升。我们的代码和预训练模型可在 \url{https://github.com/techmn/satmae_pp} 获取。

关键词

引用

@article{arxiv.2403.05419,
  title  = {Rethinking Transformers Pre-training for Multi-Spectral Satellite Imagery},
  author = {Mubashir Noman and Muzammal Naseer and Hisham Cholakkal and Rao Muhammad Anwar and Salman Khan and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2403.05419},
  year   = {2024}
}

备注

Accepted at CVPR 2024