中文

基于视觉任务适配基准的表征学习大规模研究

计算机视觉与模式识别 2020-02-24 v2 机器学习 机器学习

摘要

表征学习有望在不依赖昂贵标注数据集的情况下,为长尾视觉任务解锁深度学习。然而,缺乏针对通用视觉表征的统一评估阻碍了进展。流行的协议往往过于受限(线性分类)、多样性有限(ImageNet、CIFAR、Pascal-VOC),或与表征质量仅弱相关(ELBO、重建误差)。我们提出了视觉任务适配基准(VTAB),其将良好表征定义为能用少量样本适配多样且未见过任务的表征。借助 VTAB,我们对许多流行的公开可用表征学习算法进行了大规模研究。我们仔细控制了架构和调优预算等混杂因素。我们探讨了如下问题:ImageNet 表征在标准自然数据集之外的有效性如何?通过生成式和判别式模型训练的表征相比如何?自监督在多大程度上可替代标签?以及,我们距离通用视觉表征还有多远?

关键词

引用

@article{arxiv.1910.04867,
  title  = {A Large-scale Study of Representation Learning with the Visual Task Adaptation Benchmark},
  author = {Xiaohua Zhai and Joan Puigcerver and Alexander Kolesnikov and Pierre Ruyssen and Carlos Riquelme and Mario Lucic and Josip Djolonga and Andre Susano Pinto and Maxim Neumann and Alexey Dosovitskiy and Lucas Beyer and Olivier Bachem and Michael Tschannen and Marcin Michalski and Olivier Bousquet and Sylvain Gelly and Neil Houlsby},
  journal= {arXiv preprint arXiv:1910.04867},
  year   = {2020}
}