中文

SLIP:自监督遇见语言-图像预训练

计算机视觉与模式识别 2021-12-24 v1

摘要

近期工作表明,自监督预训练在具有挑战性的视觉识别任务上优于监督学习。CLIP 作为一种令人振奋的利用语言监督学习的新方法,在多种基准上展现出有前景的性能。在本工作中,我们探索自监督学习是否能辅助语言监督用于视觉表征学习。我们提出 SLIP,一种结合自监督学习与 CLIP 预训练的多任务学习框架。在使用 Vision Transformers 预训练后,我们在三种不同设置下彻底评估表征质量,并与 CLIP 和自监督学习比较性能:零样本迁移、线性分类和端到端微调。在 ImageNet 及一系列额外数据集上,我们发现 SLIP 大幅提升了准确率。我们通过不同模型规模、训练 schedule 和预训练数据集上的实验进一步验证了结果。我们的发现表明,SLIP 兼具两者之长:优于自监督(+8.1% 线性准确率)且优于语言监督(+5.2% 零样本准确率)。

关键词

引用

@article{arxiv.2112.12750,
  title  = {SLIP: Self-supervision meets Language-Image Pre-training},
  author = {Norman Mu and Alexander Kirillov and David Wagner and Saining Xie},
  journal= {arXiv preprint arXiv:2112.12750},
  year   = {2021}
}

备注

Code: https://github.com/facebookresearch/SLIP