中文

TurboViT:通过生成式架构搜索生成快速视觉Transformer

计算机视觉与模式识别 2023-08-23 v1 人工智能 机器学习

摘要

近年来,视觉Transformer在应对各种视觉感知任务时展现出前所未有的性能水平。然而,此类网络架构的架构与计算复杂性使其难以部署于具有高吞吐、低内存需求的现实应用中。因此,近期关于高效视觉Transformer架构设计的研究显著增多。在本研究中,我们通过生成式架构搜索(GAS)探索快速视觉Transformer架构设计的生成,以在精度与架构及计算效率之间实现强平衡。通过该生成式架构搜索过程,我们创建了TurboViT,一种围绕掩码单元注意力与Q池化设计模式生成的高效分层视觉Transformer架构设计。与ImageNet-1K数据集上相似精度范围内的其他10种最先进的高效视觉Transformer网络架构设计相比,所得到的TurboViT架构设计实现了显著更低的架构计算复杂性(比FasterViT-0小>2.47×\times且精度相同)与计算复杂性(比MobileViT2-2.0少>3.4×\times的FLOPs且精度高0.9%)。此外,TurboViT在低延迟与批处理两种场景下均展现出强劲的推理延迟与吞吐量(低延迟场景下比FasterViT-0低>3.21×\times的延迟且高>3.18×\times的吞吐量)。这些有前景的结果证明了利用生成式架构搜索为高吞吐场景生成高效Transformer架构设计的有效性。

关键词

引用

@article{arxiv.2308.11421,
  title  = {TurboViT: Generating Fast Vision Transformers via Generative Architecture Search},
  author = {Alexander Wong and Saad Abbasi and Saeejith Nair},
  journal= {arXiv preprint arXiv:2308.11421},
  year   = {2023}
}

备注

5 pages