中文

Swin Transformer V2:扩展容量与分辨率

计算机视觉与模式识别 2022-04-12 v2

摘要

大规模 NLP 模型已被证明能显著提升语言任务性能且未见饱和迹象,还展现出类似人类的惊人少样本能力。本文旨在探索计算机视觉中的大规模模型。我们解决了大型视觉模型训练与应用中的三个主要问题,包括训练不稳定、预训练与微调间的分辨率差异,以及对标注数据的渴求。提出了三项主要技术:1)结合余弦注意力的残差后归一化方法以提升训练稳定性;2)对数间隔连续位置偏置方法,以有效将使用低分辨率图像预训练的模型迁移至具有高分辨率输入的下游任务;3)自监督预训练方法 SimMIM,以减少对大量标注图像的需求。通过这些技术,本文成功训练了拥有 30 亿参数的 Swin Transformer V2 模型,这是迄今为止最大的稠密视觉模型,并使其能处理高达 1,536×\times1,536 分辨率的图像。它在四项代表性视觉任务上创下新性能纪录,包括 ImageNet-V2 图像分类、COCO 目标检测、ADE20K 语义分割和 Kinetics-400 视频动作分类。另需指出,我们的训练比 Google 的十亿级视觉模型高效得多,仅消耗其 1/40 的标注数据与 1/40 的训练时间。代码可在 \url{https://github.com/microsoft/Swin-Transformer} 获取。

关键词

引用

@article{arxiv.2111.09883,
  title  = {Swin Transformer V2: Scaling Up Capacity and Resolution},
  author = {Ze Liu and Han Hu and Yutong Lin and Zhuliang Yao and Zhenda Xie and Yixuan Wei and Jia Ning and Yue Cao and Zheng Zhang and Li Dong and Furu Wei and Baining Guo},
  journal= {arXiv preprint arXiv:2111.09883},
  year   = {2022}
}