Tokens-to-Token ViT:在 ImageNet 上从零训练视觉 Transformer
摘要
Transformer 因语言建模而流行,近来被探索用于解决视觉任务,例如用于图像分类的 Vision Transformer (ViT)。ViT 模型将每张图像分割为定长 token 序列,然后应用多个 Transformer 层建模其全局关系以进行分类。然而,当在如 ImageNet 的中等规模数据集上从零训练时,ViT 性能不及 CNN。我们发现这是因为:1)对输入图像的简单 token 化未能建模相邻像素间的重要局部结构(如边缘与线条),导致训练样本效率低;2)ViT 冗余的注意力骨干设计导致在固定计算预算与有限训练样本下特征丰富度受限。为克服此类局限,我们提出新的 Tokens-To-Token Vision Transformer (T2T-ViT),其包含:1)逐层 Tokens-to-Token (T2T) 变换,通过递归地将相邻 Token 聚合为一个 Token(Tokens-to-Token)来逐步将图像结构化至 token,从而可建模由周围 token 表示的局部结构并缩短 token 长度;2)经实证研究受 CNN 架构设计启发的深度窄式高效视觉 transformer 骨干。值得注意的是,T2T-ViT 将原始 ViT 的参数量与 MACs 减半,同时在 ImageNet 上从零训练时取得超过 3.0% 的提升。它还优于 ResNets,并通过直接在 ImageNet 上训练取得与 MobileNets 相当的性能。例如,尺寸与 ResNet50 相当(21.5M 参数)的 T2T-ViT 在 ImageNet 上图像分辨率 384384 下可达到 83.3% 的 top1 准确率。(代码:https://github.com/yitu-opensource/T2T-ViT)
引用
@article{arxiv.2101.11986,
title = {Tokens-to-Token ViT: Training Vision Transformers from Scratch on ImageNet},
author = {Li Yuan and Yunpeng Chen and Tao Wang and Weihao Yu and Yujun Shi and Zihang Jiang and Francis EH Tay and Jiashi Feng and Shuicheng Yan},
journal= {arXiv preprint arXiv:2101.11986},
year = {2021}
}
备注
ICCV 2021, codes: https://github.com/yitu-opensource/T2T-ViT