中文

用于无监督视觉表示学习的拼图聚类

计算机视觉与模式识别 2021-04-02 v1

摘要

基于对比学习的无监督表示学习取得了巨大成功。这类方法复制每个训练批次以构建对比对,使得每个训练批次及其增强版本被同时前向传播,导致额外的计算开销。本文提出一种新的拼图聚类(jigsaw clustering) pretext 任务,其只需前向传播每个训练批次自身,降低了训练成本。我们的方法利用了图像内与图像间的信息,大幅优于以往基于单批次的方法。即便仅使用一半训练批次,它也可与对比学习方法相媲美。我们的方法表明训练中的多个批次并非必要,并为未来单批次无监督方法的研究打开了大门。我们在ImageNet数据集上训练的模型通过线性分类取得了SOTA结果,以2.6%的优势超越以往单批次方法。迁移到COCO数据集的模型仅用一半训练批次即以0.4%优势超越MoCo v2。我们的预训练模型在CIFAR-10与CIFAR-100数据集上分别以0.9%和4.1%的优势优于有监督ImageNet预训练模型。代码见 https://github.com/Jia-Research-Lab/JigsawClustering

关键词

引用

@article{arxiv.2104.00323,
  title  = {Jigsaw Clustering for Unsupervised Visual Representation Learning},
  author = {Pengguang Chen and Shu Liu and Jiaya Jia},
  journal= {arXiv preprint arXiv:2104.00323},
  year   = {2021}
}

备注

CVPR 2021 Oral