中文

自监督视觉表征学习的扩展与基准测试

计算机视觉与模式识别 2019-06-07 v2 人工智能 机器学习

摘要

自监督学习旨在无需显式人工监督的情况下从数据本身学习表征。现有的努力忽略了自监督学习的一个关键方面——扩展到大量数据的能力,因为自监督不需要人工标签。在这项工作中,我们重新审视了这一原则,并将两种流行的自监督方法扩展到 1 亿张图像。我们表明,通过在各种轴上(包括数据规模和问题“难度”)进行扩展,可以在多种任务上大幅匹配甚至超越监督预训练的性能,例如目标检测、表面法线估计(3D)以及使用强化学习的视觉导航。扩展这些方法还为当前自监督技术和评估的局限性提供了许多有趣的见解。我们得出结论,当前的自监督方法不够“困难”,无法充分利用大规模数据,并且似乎没有学习到有效的高层语义表征。我们还引入了一个涵盖 9 个不同数据集和任务的广泛基准测试。我们相信,这样的基准测试连同可比的评估设置对于取得有意义的进展是必要的。代码位于:https://github.com/facebookresearch/fair_self_supervision_benchmark。

关键词

引用

@article{arxiv.1905.01235,
  title  = {Scaling and Benchmarking Self-Supervised Visual Representation Learning},
  author = {Priya Goyal and Dhruv Mahajan and Abhinav Gupta and Ishan Misra},
  journal= {arXiv preprint arXiv:1905.01235},
  year   = {2019}
}