更深的图像 Transformer 探索
计算机视觉与模式识别
2021-04-08 v2
摘要
Transformer 近期被适配于大规模图像分类,取得了高分并动摇了卷积神经网络长久的霸主地位。然而,图像 Transformer 的优化迄今鲜有研究。在本工作中,我们构建并优化更深层的 Transformer 网络用于图像分类。特别地,我们研究了此类专用 Transformer 的架构与优化之间的相互作用。我们做了两处 Transformer 架构改变,显著提升了深层 Transformer 的准确率。这使我们生成的模型性能不会随深度增加而过早饱和,例如我们在无外部数据训练的情况下于 Imagenet 上取得 86.5% 的 top-1 准确率,从而以更少的 FLOPs 和参数达到当前 SOTA。此外,在无需额外训练数据的设定下,我们的最佳模型在带重评估标签的 Imagenet 以及 Imagenet-V2 / match frequency 上确立了新的 state of the art。我们共享了代码与模型。
引用
@article{arxiv.2103.17239,
title = {Going deeper with Image Transformers},
author = {Hugo Touvron and Matthieu Cord and Alexandre Sablayrolles and Gabriel Synnaeve and Hervé Jégou},
journal= {arXiv preprint arXiv:2103.17239},
year = {2021}
}