中文

Divide and Contrast:基于未策展数据的自监督学习

计算机视觉与模式识别 2021-05-18 v1

摘要

自监督学习在利用大量无标签数据方面大有前景,然而其诸多进展迄今仍局限于高度策展的预训练数据(如 ImageNet)。我们探究了从更大、策展程度更低的图像数据集(如 YFCC)进行对比学习的影响,发现所得表征质量确实存在巨大差异。我们假设这种策展差距源于图像类别分布的偏移——其更加多样且呈重尾分布——导致可学习的负样本相关性降低。我们用一种新方法“Divide and Contrast(DnC)”验证了该假设,该方法在对比学习与基于聚类的难负样本挖掘之间交替进行。当在未策展数据集上预训练时,DnC 大幅提升了自监督学习在下游任务上的性能,同时在策展数据集上仍与当前最先进水平相当。

关键词

引用

@article{arxiv.2105.08054,
  title  = {Divide and Contrast: Self-supervised Learning from Uncurated Data},
  author = {Yonglong Tian and Olivier J. Henaff and Aaron van den Oord},
  journal= {arXiv preprint arXiv:2105.08054},
  year   = {2021}
}