中文

一网打尽:迈向地球视觉的统一基础模型

计算机视觉与模式识别 2024-05-29 v2

摘要

以海量参数和大规模数据集训练为特征的基础模型,在遥感数据的各种下游任务中已展现出卓越的效能。当前的遥感基础模型通常专注于单一模态或特定的空间分辨率范围,限制了它们对下游数据集的通用性。尽管已有尝试开发多模态遥感基础模型,但它们通常为每种模态或空间分辨率采用单独的视觉编码器,需要根据输入数据切换骨干网络。为了解决这个问题,我们引入了一种简单而有效的方法,称为 OFA-Net(一网打尽网络):为具有不同空间分辨率的多种数据模态采用一个单一的、共享的 Transformer 骨干网络。利用掩码图像建模机制,我们基于这种简单的设计,在一个精心构建的多模态数据集上预训练一个单一的 Transformer 骨干网络。然后,该骨干模型可用于不同的下游任务,从而为地球视觉中统一的基础骨干模型开辟了一条道路。所提出的方法在 12 个不同的下游任务上进行了评估,并展示了令人鼓舞的性能。

关键词

引用

@article{arxiv.2401.07527,
  title  = {One for All: Toward Unified Foundation Models for Earth Vision},
  author = {Zhitong Xiong and Yi Wang and Fahong Zhang and Xiao Xiang Zhu},
  journal= {arXiv preprint arXiv:2401.07527},
  year   = {2024}
}

备注

5 pages