EfficientFormer:以 MobileNet 速度运行的视觉 Transformer
计算机视觉与模式识别
2022-10-12 v5
摘要
视觉 Transformer(ViT)在计算机视觉任务中展现出快速进展,在各种基准上取得了有前景的结果。然而,由于参数量巨大及模型设计(如注意力机制),基于 ViT 的模型通常比轻量卷积网络慢数倍。因此,ViT 在实时应用中的部署尤其具有挑战性,特别是在移动设备等资源受限的硬件上。近期工作试图通过网络架构搜索或与 MobileNet 模块混合设计来降低 ViT 的计算复杂度,但推理速度仍不尽如人意。这引出一个重要问题:transformer 能否在保持高性能的同时运行得和 MobileNet 一样快?为回答此问题,我们首先重新审视基于 ViT 的模型中使用的网络架构与算子,并识别出低效设计。随后我们引入一种维度一致的纯 transformer(不含 MobileNet 模块)作为设计范式。最后,我们执行延迟驱动的瘦身以获得一系列最终模型,称为 EfficientFormer。大量实验显示了 EfficientFormer 在移动设备上性能与速度方面的优越性。我们最快的模型 EfficientFormer-L1 在 ImageNet-1K 上以仅 ms 的推理延迟(基于 CoreML 编译)取得 的 top-1 准确率,其运行速度与 MobileNetV2( ms, top-1)相当;而我们最大的模型 EfficientFormer-L7 仅以 ms 延迟获得 准确率。我们的工作证明,恰当设计的 transformer 能在移动设备上达到极低延迟同时保持高性能。
引用
@article{arxiv.2206.01191,
title = {EfficientFormer: Vision Transformers at MobileNet Speed},
author = {Yanyu Li and Geng Yuan and Yang Wen and Ju Hu and Georgios Evangelidis and Sergey Tulyakov and Yanzhi Wang and Jian Ren},
journal= {arXiv preprint arXiv:2206.01191},
year = {2022}
}