中文

自监督视觉Transformer训练的经验研究

计算机视觉与模式识别 2021-08-17 v4 机器学习

摘要

本文未描述一种新方法。相反,鉴于计算机视觉的最新进展,它研究了一个直白、渐进但必须了解的基线:视觉Transformer(ViT)的自监督学习。虽然标准卷积网络的训练方案已高度成熟稳健,ViT 的方案尚待建立,尤其在训练更具挑战性的自监督场景中。本工作中,我们回归基础,考察几个训练自监督 ViT 的基本组件的影响。我们观察到不稳定性是降低精度的主要问题,且它可能被表面良好的结果所掩盖。我们揭示这些结果实为局部失败,而在训练更稳定时可被改善。我们在 MoCo v3 及若干其他自监督框架中基准测试 ViT 结果,并进行多方面的消融实验。我们讨论当前的正面证据以及挑战与开放问题。希望本工作能为未来研究提供有用的数据点与经验。

关键词

引用

@article{arxiv.2104.02057,
  title  = {An Empirical Study of Training Self-Supervised Vision Transformers},
  author = {Xinlei Chen and Saining Xie and Kaiming He},
  journal= {arXiv preprint arXiv:2104.02057},
  year   = {2021}
}

备注

Camera-ready, ICCV 2021, Oral. Code: https://github.com/facebookresearch/moco-v3