中文

TinyViT:面向小型视觉Transformer的快速预训练蒸馏

计算机视觉与模式识别 2022-07-22 v1

摘要

视觉Transformer(ViT)近期因卓越的模型能力在计算机视觉中备受关注。然而,大多数主流ViT模型参数量巨大,限制了其在资源受限设备上的适用性。为缓解该问题,我们提出TinyViT,一个在大规模数据集上通过我们提出的快速蒸馏框架预训练的微小且高效的小型视觉Transformer新系列。其核心思想是将大型预训练模型的知识迁移到小型模型,同时使小模型获得大规模预训练数据的红利。更具体地,我们在预训练期间应用蒸馏进行知识迁移。大型教师模型的logits被提前稀疏化并存储于磁盘,以节省内存开销和计算开销。微小学生Transformer根据计算和参数约束从大型预训练模型自动缩放得到。综合实验证明了TinyViT的有效性。它在ImageNet-1k上以仅21M参数达到84.8%的top-1准确率,与在ImageNet-21k上预训练的Swin-B相当,而参数少用4.2倍。此外,提高图像分辨率后,TinyViT可达到86.5%的准确率,略优于Swin-L而仅使用11%的参数。最后但同样重要的是,我们展示了TinyViT在各种下游任务上的良好迁移能力。代码和模型可在 https://github.com/microsoft/Cream/tree/main/TinyViT 获取。

关键词

引用

@article{arxiv.2207.10666,
  title  = {TinyViT: Fast Pretraining Distillation for Small Vision Transformers},
  author = {Kan Wu and Jinnian Zhang and Houwen Peng and Mengchen Liu and Bin Xiao and Jianlong Fu and Lu Yuan},
  journal= {arXiv preprint arXiv:2207.10666},
  year   = {2022}
}

备注

Accepted by ECCV 2022