2022 年的视觉 Transformer:Tiny ImageNet 上的最新结果
计算机视觉与模式识别
2022-05-24 v1
摘要
图像 transformer 近期的进展展示了令人印象深刻的成果,并大幅缩小了与传统 CNN 架构之间的差距。标准流程是在 ImageNet-21k 等大型数据集上训练,然后在 ImageNet-1k 上微调。微调后,研究通常考虑在 CIFAR-10/100 等较小数据集上的迁移学习性能,却忽略了 Tiny ImageNet。本文提供了视觉 transformer 在 Tiny ImageNet 上性能的最新结果。我包含了 Vision Transformer (ViT)、Data Efficient Image Transformer (DeiT)、Class Attention in Image Transformer (CaiT) 和 Swin Transformers。此外,Swin Transformers 以 91.35% 的验证准确率打破了当前最优结果。代码见:https://github.com/ehuynh1106/TinyImageNet-Transformers
引用
@article{arxiv.2205.10660,
title = {Vision Transformers in 2022: An Update on Tiny ImageNet},
author = {Ethan Huynh},
journal= {arXiv preprint arXiv:2205.10660},
year = {2022}
}