中文

通过多任务预训练提升遥感基础模型

计算机视觉与模式识别 2024-05-31 v2

摘要

基础模型已重塑了遥感(RS)图像解释任务的格局,通过增强各种图像解释任务的性能来实现。预训练是活跃的研究主题,涵盖监督学习和自监督学习方法,以有效初始化模型权重。然而,将预训练模型迁移到下游任务可能因其将预训练 formulations 为图像分类或对象判别任务而遇到任务差异。本研究探索了遥感基础模型的多任务预训练(MTP)范式,以解决此问题。使用共享编码器和任务特定解码器架构,我们在SAMRS数据集上对语义分割、实例分割和旋转对象检测进行多任务监督预训练。MTP支持卷积神经网络和视觉转换器基础模型,参数规模超过3000万。预训练模型在各种遥感下游任务上进行微调,包括场景分类、水平和旋转对象检测、语义分割和变化检测。广泛的实验覆盖14个数据集,表明我们的模型在大小相似的现有模型上表现出优势,并且与更大规模的SOTA模型性能相competitive,从而验证了MTP的有效性。

关键词

引用

@article{arxiv.2403.13430,
  title  = {MTP: Advancing Remote Sensing Foundation Model via Multi-Task Pretraining},
  author = {Di Wang and Jing Zhang and Minqiang Xu and Lin Liu and Dongsheng Wang and Erzhong Gao and Chengxi Han and Haonan Guo and Bo Du and Dacheng Tao and Liangpei Zhang},
  journal= {arXiv preprint arXiv:2403.13430},
  year   = {2024}
}

备注

Accepted by IEEE JSTARS Special issue on "Large-Scale Pretraining for Interpretation Promotion in Remote Sensing Domain". The codes and pretrained models are available at https://github.com/ViTAE-Transformer/MTP