中文

大规模数据集对自监督预训练是否必要?

计算机视觉与模式识别 2021-12-21 v1

摘要

在计算机视觉中,在如 ImageNet 的大规模数据集上预训练模型是一种标准做法。该范式对训练集较小的任务尤其有效,因为高容量模型往往过拟合。本工作中,我们考虑一种仅利用目标任务数据的自监督预训练场景。我们考虑的数据集如 Stanford Cars、Sketch 或 COCO,其规模比 ImageNet 小一到多个数量级。我们的研究表明,去噪自编码器(如 BEiT 或我们在本文中引入的一个变体)相比通过比对图像嵌入训练的主流自监督方法,对预训练数据的类型和规模更具鲁棒性。我们在来自不同领域的多种分类数据集上取得了与 ImageNet 预训练相竞争的性能。在 COCO 上,当仅使用 COCO 图像进行预训练时,检测和实例分割性能超越了同等设置下监督式 ImageNet 预训练。

关键词

引用

@article{arxiv.2112.10740,
  title  = {Are Large-scale Datasets Necessary for Self-Supervised Pre-training?},
  author = {Alaaeldin El-Nouby and Gautier Izacard and Hugo Touvron and Ivan Laptev and Hervé Jegou and Edouard Grave},
  journal= {arXiv preprint arXiv:2112.10740},
  year   = {2021}
}