中文

推动普通视觉 Transformer 迈向遥感基础模型

计算机视觉与模式识别 2022-12-09 v4

摘要

大规模视觉基础模型在自然图像视觉任务上已取得显著进展,视觉 transformer 因其良好的可扩展性和表征能力成为首选。然而,遥感(RS)中的大规模模型尚未得到充分探索。本文中,我们采用约一亿参数的普通视觉 transformer,首次尝试提出专为 RS 任务定制的大规模视觉模型,并研究此类大模型的表现。为处理 RS 图像中较大的尺寸和任意朝向的物体,我们提出一种新的旋转变尺寸窗口注意力来替换 transformer 中原有的全注意力,其能通过从生成的多样化窗口中提取丰富上下文,在显著降低计算成本和内存占用的同时学习更好的物体表征。检测任务上的实验表明我们的模型优于所有最先进模型,在 DOTA-V1.0 数据集上达到 81.24% mAP。我们的模型在下游分类和分割任务上的结果也显示出与现有先进方法相比具有竞争力的性能。进一步实验显示了我们的模型在迁移中的计算复杂度和数据效率方面的优势。

关键词

引用

@article{arxiv.2208.03987,
  title  = {Advancing Plain Vision Transformer Towards Remote Sensing Foundation Model},
  author = {Di Wang and Qiming Zhang and Yufei Xu and Jing Zhang and Bo Du and Dacheng Tao and Liangpei Zhang},
  journal= {arXiv preprint arXiv:2208.03987},
  year   = {2022}
}

备注

Accepted by IEEE TGRS. The codes and models are released at https://github.com/ViTAE-Transformer/Remote-Sensing-RVSA