中文

监督无处不在:一种数据高效的对比语言-图像预训练范式

计算机视觉与模式识别 2022-03-15 v2

摘要

近来,大规模对比语言-图像预训练(CLIP)因其令人瞩目的零样本识别能力以及对下游任务的优异可迁移性而受到空前关注。然而,CLIP 极为耗费数据,需要 4 亿图像-文本对进行预训练,从而限制了其应用。本工作提出一种新颖的训练范式——数据高效 CLIP(DeCLIP),以缓解此限制。我们证明,通过精心利用图像-文本对间广泛存在的监督,我们的 DeCLIP 能够更高效地学习通用视觉特征。不同于使用单一的图像-文本对比监督,我们通过以下方式充分挖掘数据潜力:(1) 各模态内的自监督;(2) 跨模态的多视图监督;(3) 来自其他相似对的近邻监督。得益于内在监督,我们的 DeCLIP-ResNet50 在 ImageNet 上可实现 60.4% 的零样本 top1 准确率,较 CLIP-ResNet50 高出 0.8%,同时仅使用 7.1 倍更少的数据。在迁移至下游任务时,我们的 DeCLIP-ResNet50 在 11 个视觉数据集中的 8 个上优于其对应模型。此外,在我们的框架中扩大模型与计算量同样表现良好。我们的代码、数据集与模型发布于:https://github.com/Sense-GVT/DeCLIP

关键词

引用

@article{arxiv.2110.05208,
  title  = {Supervision Exists Everywhere: A Data Efficient Contrastive Language-Image Pre-training Paradigm},
  author = {Yangguang Li and Feng Liang and Lichen Zhao and Yufeng Cui and Wanli Ouyang and Jing Shao and Fengwei Yu and Junjie Yan},
  journal= {arXiv preprint arXiv:2110.05208},
  year   = {2022}
}

备注

17 pages, 10 figures