中文

基于对比掩码预测的自监督视觉表征学习

计算机视觉与模式识别 2021-08-19 v1

摘要

先进的自监督视觉表征学习方法依赖于实例判别(ID) pretext 任务。我们指出,ID 任务具有一种隐式的语义一致性(SC)假设,该假设在非受限数据集中可能不成立。本文中,我们提出了一种用于视觉表征学习的新型对比掩码预测(CMP)任务,并设计了一个掩码对比(MaskCo)框架来实现该想法。MaskCo 对比区域级特征而非视图级特征,使其无需任何假设即可识别正样本。为解决掩码与未掩码特征之间的域间隙,我们在 MaskCo 中设计了一个专用的掩码预测头。该模块被证明是 CMP 成功的关键。我们在 ImageNet 之外的训练数据集上评估了 MaskCo,并将其性能与 MoCo V2 进行比较。结果表明,在使用 ImageNet 训练数据集时,MaskCo 取得了与 MoCo V2 相当的性能;但在使用 COCO 或 Conceptual Captions 进行训练时,其在一系列下游任务上展现出更强的性能。MaskCo 为基于 ID 的方法提供了一种在真实场景下自监督学习的有前景的替代方案。

关键词

引用

@article{arxiv.2108.07954,
  title  = {Self-Supervised Visual Representations Learning by Contrastive Mask Prediction},
  author = {Yucheng Zhao and Guangting Wang and Chong Luo and Wenjun Zeng and Zheng-Jun Zha},
  journal= {arXiv preprint arXiv:2108.07954},
  year   = {2021}
}

备注

Accepted to ICCV 2021