中文

遥感预训练的经验性研究

计算机视觉与模式识别 2023-07-19 v4

摘要

深度学习在很大程度上重塑了用于航拍图像理解的遥感(RS)研究并取得巨大成功。然而,现有多数深度模型均以ImageNet预训练权重初始化。由于自然图像相对于航拍图像不可避免地存在较大域差距,这可能限制下游航拍场景任务的微调性能。该问题促使我们对航拍图像上的遥感预训练(RSP)进行经验性研究。为此,我们借助迄今最大的RS场景识别数据集MillionAID从头训练不同网络,获得一系列RS预训练骨干网络,包括卷积神经网络(CNN)以及在计算机视觉任务中表现优异的视觉Transformer(如Swin和ViTAE)。随后,我们利用这些CNN与视觉Transformer骨干网络,研究RSP对代表性下游任务的影响,包括场景识别、语义分割、目标检测与变化检测。经验研究表明,RSP可在场景识别任务及感知“桥梁”与“飞机”等RS相关语义方面带来显著性能提升。我们还发现,尽管RSP缓解了传统ImageNet预训练在RS图像上的数据差异,仍可能受任务差异影响,即下游任务所需表征不同于场景识别任务。这些发现呼吁在大规模预训练数据集与有效预训练方法上开展进一步研究。代码与预训练模型将于 https://github.com/ViTAE-Transformer/ViTAE-Transformer-Remote-Sensing 发布。

关键词

引用

@article{arxiv.2204.02825,
  title  = {An Empirical Study of Remote Sensing Pretraining},
  author = {Di Wang and Jing Zhang and Bo Du and Gui-Song Xia and Dacheng Tao},
  journal= {arXiv preprint arXiv:2204.02825},
  year   = {2023}
}

备注

Accepted by IEEE TGRS, codes and pretrained models are moved to https://github.com/ViTAE-Transformer/RSP