中文

基于 Swin Transformer 的自监督学习

计算机视觉与模式识别 2021-05-12 v2

摘要

我们正见证计算机视觉中从 CNN 到 Transformer 的建模转变。在这项工作中,我们提出了一种称为 MoBY 的自监督学习方法,以 Vision Transformer 作为其骨干架构。该方法基本没有新发明,由 MoCo v2 和 BYOL 组合而成,并经过调优以在 ImageNet-1K 线性评测上达到合理的高精度:使用 DeiT-S 和 Swin-T 经 300 轮训练分别取得 72.8% 和 75.0% 的 top-1 精度。该性能略优于近期采用 DeiT 为骨干的 MoCo v3 和 DINO 工作,但所用技巧轻量得多。更重要的是,通用型 Swin Transformer 骨干使我们还能在目标检测与语义分割等下游任务上评测所学表征,而少数近期基于 ViT/DeiT 的方法仅报告 ImageNet-1K 上的线性评测结果,因为 ViT/DeiT 未被驯化为适用于这些密集预测任务。我们希望我们的结果能促进对为 Transformer 架构设计的自监督学习方法进行更全面的评测。我们的代码与模型发布于 https://github.com/SwinTransformer/Transformer-SSL,并将持续丰富。

关键词

引用

@article{arxiv.2105.04553,
  title  = {Self-Supervised Learning with Swin Transformers},
  author = {Zhenda Xie and Yutong Lin and Zhuliang Yao and Zheng Zhang and Qi Dai and Yue Cao and Han Hu},
  journal= {arXiv preprint arXiv:2105.04553},
  year   = {2021}
}