中文

重访视觉感知模型的弱监督预训练

计算机视觉与模式识别 2022-04-05 v2

摘要

模型预训练是现代视觉识别系统的基石。尽管在 ImageNet 等数据集上的全监督预训练仍是事实上的标准,但近期研究表明大规模弱监督预训练可以优于全监督方法。本文使用标签监督(hashtag supervision)以现代版本的残差网络和史上最大的图像及对应标签数据集,重访模型的弱监督预训练。我们研究了所得模型在各种迁移学习设置(包括零样本迁移)下的性能。我们还将我们的模型与通过大规模自监督学习获得的模型进行比较。我们发现我们的弱监督模型在所有设置下都极具竞争力,并发现它们大幅优于其自监督对应模型。我们还调查了我们的模型是否学到了潜在令人不安的关联或刻板印象。总体而言,我们的结果为在视觉识别系统开发中使用弱监督学习提供了有力论据。我们的模型 Supervised Weakly through hashtAGs (SWAG) 已公开可用。

关键词

引用

@article{arxiv.2201.08371,
  title  = {Revisiting Weakly Supervised Pre-Training of Visual Perception Models},
  author = {Mannat Singh and Laura Gustafson and Aaron Adcock and Vinicius de Freitas Reis and Bugra Gedik and Raj Prateek Kosaraju and Dhruv Mahajan and Ross Girshick and Piotr Dollár and Laurens van der Maaten},
  journal= {arXiv preprint arXiv:2201.08371},
  year   = {2022}
}

备注

CVPR 2022