中文

训练数据高效的图像Transformer及基于注意力的蒸馏

计算机视觉与模式识别 2021-01-18 v2

摘要

近来,纯基于注意力的神经网络被证明可处理图像分类等图像理解任务。然而,这些视觉Transformer使用昂贵的基础设施以数亿张图像预训练,从而限制了其应用。在本工作中,我们仅通过在ImageNet上训练,产出了具有竞争力的无卷积Transformer。我们在单台计算机上以不到3天时间完成训练。我们的参考视觉Transformer(86M参数)在ImageNet上无外部数据取得83.1%的top-1准确率(单裁剪评估)。更重要的是,我们引入一种专用于Transformer的师生策略。它依赖于一个蒸馏token,确保学生通过注意力向教师学习。我们展示了这种基于token的蒸馏的益处,尤其在使用convnet作为教师时。这使我们报告了在ImageNet(最高达85.2%准确率)及迁移至其他任务时与convnets相竞争的成果。我们共享了代码与模型。

关键词

引用

@article{arxiv.2012.12877,
  title  = {Training data-efficient image transformers & distillation through attention},
  author = {Hugo Touvron and Matthieu Cord and Matthijs Douze and Francisco Massa and Alexandre Sablayrolles and Hervé Jégou},
  journal= {arXiv preprint arXiv:2012.12877},
  year   = {2021}
}