中文

基于视觉Transformer的检测迁移学习基准评测

计算机视觉与模式识别 2021-11-23 v1

摘要

目标检测是用于测试预训练网络参数是否带来益处(如精度提升或训练加速)的一个核心下游任务。当诸如视觉Transformer(ViT)模型等新架构出现时,目标检测方法的复杂性会使此类基准评测变得不平凡。这些困难(例如架构不兼容、训练缓慢、高内存消耗、未知训练公式等)阻碍了近期研究使用标准ViT模型对检测迁移学习进行基准评测。在本文中,我们提出了克服这些挑战的训练技术,使得标准ViT模型能够作为Mask R-CNN的骨干网络。这些工具促进了我们研究的主要目标:我们比较了五种ViT初始化方式,包括近期最先进的自监督学习方法、监督初始化以及一个强随机初始化基线。我们的结果表明,近期基于掩码的的无监督学习方法可能首次在COCO上提供令人信服的迁移学习改进,相较监督和先前的自监督预训练方法将框AP提升高达4%(绝对数值)。此外,这些基于掩码的初始化具有更好的可扩展性,随着模型尺寸增大改进也随之增长。

关键词

引用

@article{arxiv.2111.11429,
  title  = {Benchmarking Detection Transfer Learning with Vision Transformers},
  author = {Yanghao Li and Saining Xie and Xinlei Chen and Piotr Dollar and Kaiming He and Ross Girshick},
  journal= {arXiv preprint arXiv:2111.11429},
  year   = {2021}
}