十亿级遥感图像基础模型
计算机视觉与模式识别
2024-08-13 v4 人工智能
机器学习
摘要
随着基础模型在视觉任务中的潜力获得显著关注,在下游任务之前对这些模型进行预训练已成为关键步骤。预训练基础模型的三个关键因素是预训练方法、预训练数据集的规模以及模型参数量。近来,遥感领域的研究主要集中于预训练方法与数据集规模,对模型参数量的关注有限。本文通过考察增加模型参数量对旋转目标检测与语义分割等下游任务中基础模型性能的影响,弥补了这一不足。我们预训练了具有不同参数量(包括 86M、605.26M、1.3B 与 2.4B)的基础模型,以确定下游任务性能是否随参数增加而提升。据我们所知,这是遥感领域首个十亿级基础模型。此外,我们提出了一种在遥感领域扩展与微调 vision transformer 的有效方法。为评估下游任务中的总体性能,我们采用 DOTA v2.0 与 DIOR-R 基准数据集进行旋转目标检测,并采用 Potsdam 与 LoveDA 数据集进行语义分割。实验结果表明,在所有基准数据集与下游任务中,基础模型的性能与数据效率均随参数量增加而提升。而且,我们的模型在包括 DIOR-R、Postdam 与 LoveDA 在内的多个数据集上取得了 SOTA 性能。
引用
@article{arxiv.2304.05215,
title = {A Billion-scale Foundation Model for Remote Sensing Images},
author = {Keumgang Cha and Junghoon Seo and Taekyung Lee},
journal= {arXiv preprint arXiv:2304.05215},
year = {2024}
}
备注
This manuscript is the accepted version for IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing (IEEE J-STARS)