解构对比自监督学习:不变性、增广与数据集偏差
计算机视觉与模式识别
2020-07-30 v2
摘要
自监督表示学习方法近期在目标检测与图像分类等下游任务上已超越其有监督学习对应方法。某种程度上令人困惑的是,近期性能提升来自训练实例分类模型,将每幅图像及其增广版本视为单一类的样本。本工作中,我们首先给出定量实验以解构这些提升。我们证明MOCO和PIRL等方法学习到遮挡不变表示。然而,它们未能捕捉视点与类别实例不变性,而后者是物体识别的关键组成。其次,我们证明这些方法因能访问如Imagenet般干净的以物体为中心的训练集而获得进一步提升。最后,我们提出一种利用非结构化视频学习具有更高视点不变性表示的方法。我们的结果表明,所学表示在编码的不变性以及下游图像分类与语义分割任务性能上,均优于在相同数据上训练的MOCOv2。
引用
@article{arxiv.2007.13916,
title = {Demystifying Contrastive Self-Supervised Learning: Invariances, Augmentations and Dataset Biases},
author = {Senthil Purushwalkam and Abhinav Gupta},
journal= {arXiv preprint arXiv:2007.13916},
year = {2020}
}