中文

大型掩码自编码器预训练对下游地球观测任务的有效性如何?

计算机视觉与模式识别 2024-09-30 v1

摘要

自监督预训练已被证明对许多计算机视觉任务非常有效,尤其是在标注数据稀缺时。在地球观测(EO)领域,基础模型和各种其他基于 Vision Transformer (ViT) 的方法已成功应用于下游任务的迁移学习。然而,目前尚不清楚在何种条件下预训练模型相比从头训练具有显著优势。在本研究中,我们研究了基于 ViT 的掩码自编码器(MAE)预训练对下游 EO 任务的有效性,重点关注重建、分割和分类。我们考虑了两个大型基于 ViT 的 MAE 预训练模型:一个基础模型(Prithvi)和 SatMAE。我们在基于重建和分割的下游任务上评估了 Prithvi,并在分类下游任务上评估了 SatMAE 的性能。我们的研究结果表明,当微调任务与预训练任务(例如重建)高度相似时,预训练尤为有益。相比之下,对于分割或分类等任务,通过特定超参数调整从头训练被证明同样有效甚至更有效。

关键词

引用

@article{arxiv.2409.18536,
  title  = {How Effective is Pre-training of Large Masked Autoencoders for Downstream Earth Observation Tasks?},
  author = {Jose Sosa and Mohamed Aloulou and Danila Rukhovich and Rim Sleimi and Boonyarit Changaival and Anis Kacem and Djamila Aouada},
  journal= {arXiv preprint arXiv:2409.18536},
  year   = {2024}
}