中文

通过预测图像旋转进行无监督表示学习

计算机视觉与模式识别 2018-03-22 v1 机器学习

摘要

近年来,深度卷积神经网络(ConvNets)凭借其学习高层语义图像特征的无与伦比的能力,彻底改变了计算机视觉领域。然而,为了成功学习这些特征,它们通常需要海量的手动标注数据,这既昂贵又难以规模化扩展。因此,无监督语义特征学习,即无需人工标注即可进行学习,对于成功利用当今可用的大量视觉数据至关重要。在我们的工作中,我们提出通过训练 ConvNets 来识别输入图像所应用的 2D 旋转,从而学习图像特征。我们定性和定量地证明了,这个看似简单的任务实际上为语义特征学习提供了非常强大的监督信号。我们在各种无监督特征学习基准上详尽地评估了我们的方法,并在所有基准中均展现出 SOTA 性能。具体而言,我们在这些基准上的结果表明,相较于先前无监督表示学习的 SOTA 方法取得了显著改进,从而大幅缩小了与监督特征学习的差距。例如,在 PASCAL VOC 2007 检测任务中,我们无监督预训练的 AlexNet 模型实现了 SOTA(在无监督方法中)54.4% 的 mAP,仅比监督情况低 2.4 个百分点。当我们将无监督学习到的特征迁移到各种其他任务(如 ImageNet 分类、PASCAL 分类、PASCAL 分割和 CIFAR-10 分类)时,我们获得了同样惊人的结果。我们论文的代码和模型将发布于:https://github.com/gidariss/FeatureLearningRotNet 。

关键词

引用

@article{arxiv.1803.07728,
  title  = {Unsupervised Representation Learning by Predicting Image Rotations},
  author = {Spyros Gidaris and Praveer Singh and Nikos Komodakis},
  journal= {arXiv preprint arXiv:1803.07728},
  year   = {2018}
}

备注

Accepted at ICLR2018. Code and models will be published on: https://github.com/gidariss/FeatureLearningRotNet