中文

面向大众的 ImageNet-21K 预训练

计算机视觉与模式识别 2021-08-06 v4 机器学习

摘要

ImageNet-1K 是预训练计算机视觉任务深度学习模型的主要数据集。规模更大且更多样化的 ImageNet-21K 数据集用于预训练的频率较低,主要因其复杂性、低可及性以及对其附加价值的低估。本文旨在弥补这一差距,使人人都能进行高质量、高效的 ImageNet-21K 预训练。通过专门的预处理阶段、利用 WordNet 层次结构以及一种称为语义 softmax 的新训练方案,我们展示了多种模型在众多数据集和任务(包括面向移动端的小型模型)上显著受益于 ImageNet-21K 预训练。我们还表明,对于 ViT 和 Mixer 等著名新模型,我们的方法优于以往的 ImageNet-21K 预训练方案。我们提出的预训练流程高效、易用,并基于公开可用数据集得出可复现的 SOTA 结果。训练代码与预训练模型见:https://github.com/Alibaba-MIIL/ImageNet21K

关键词

引用

@article{arxiv.2104.10972,
  title  = {ImageNet-21K Pretraining for the Masses},
  author = {Tal Ridnik and Emanuel Ben-Baruch and Asaf Noy and Lihi Zelnik-Manor},
  journal= {arXiv preprint arXiv:2104.10972},
  year   = {2021}
}

备注

Accepted to NeurIPS 2021 (Datasets and Benchmarks)