FastViT:一种利用结构重参数化的快速混合视觉 Transformer
计算机视觉与模式识别
2023-08-21 v2
摘要
近期 Transformer 与卷积设计的融合使模型的精度与效率稳步提升。本文中,我们提出 FastViT,一种获得最先进延迟-精度权衡的混合视觉 Transformer 架构。为此,我们引入一种新颖的 token 混合算子 RepMixer——FastViT 的基本构件,其利用结构重参数化通过移除网络中的跳跃连接来降低内存访问代价。我们进一步应用训练时过参数化与大核卷积以提升精度,并经验性地表明这些选择对延迟影响极小。我们表明——在移动设备上,对于 ImageNet 数据集上相同精度,我们的模型比近期最先进的混合 Transformer 架构 CMT 快 3.5 倍,比 EfficientNet 快 4.9 倍,比 ConvNeXt 快 1.9 倍。在相似延迟下,我们的模型在 ImageNet 上比 MobileOne 的 Top-1 精度高 4.2%。我们的模型在多项任务上持续优于竞争架构——图像分类、检测、分割与 3D 网格回归,且在移动设备与桌面 GPU 上延迟均有显著改善。此外,我们的模型对分布外样本与扰动高度鲁棒,优于竞争的鲁棒模型。代码与模型见 https://github.com/apple/ml-fastvit。
引用
@article{arxiv.2303.14189,
title = {FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization},
author = {Pavan Kumar Anasosalu Vasu and James Gabriel and Jeff Zhu and Oncel Tuzel and Anurag Ranjan},
journal= {arXiv preprint arXiv:2303.14189},
year = {2023}
}
备注
ICCV 2023