中文

AutoFormer:面向视觉识别的Transformer搜索

计算机视觉与模式识别 2021-07-02 v1

摘要

近年来,纯基于transformer的模型在图像分类和检测等视觉任务中展现出了巨大潜力。然而,transformer网络的设计具有挑战性。据观察,深度、嵌入维度和头数会极大影响视觉transformer的性能。此前的模型基于手工设计来配置这些维度。在本工作中,我们提出一种新的单次架构搜索框架,即AutoFormer,专用于视觉transformer搜索。AutoFormer在超网训练期间将同一层中不同块的权重纠缠在一起。得益于该策略,训练好的超网使得数千个子网能够得到非常好的训练。具体而言,这些从超网继承权重的子网的性能与从头重新训练的 subnet 相当。此外,我们所称的AutoFormers的搜索模型超越了近期的最先进方法,如ViT和DeiT。特别地,AutoFormer-tiny/small/base在ImageNet上分别以5.7M/22.9M/53.7M参数量达到74.7%/81.7%/82.4%的top-1准确率。最后,我们通过提供下游基准和蒸馏实验上的性能来验证AutoFormer的可迁移性。代码和模型可在 https://github.com/microsoft/AutoML 获取。

关键词

引用

@article{arxiv.2107.00651,
  title  = {AutoFormer: Searching Transformers for Visual Recognition},
  author = {Minghao Chen and Houwen Peng and Jianlong Fu and Haibin Ling},
  journal= {arXiv preprint arXiv:2107.00651},
  year   = {2021}
}

备注

Github: https://github.com/microsoft/AutoML