中文

FMViT:一种多频率混合视觉 Transformer

计算机视觉与模式识别 2023-11-13 v1

摘要

近年来,Transformer 模型在计算机视觉任务中获得了广泛采用。然而,由于自注意力的二次时间和内存复杂度与输入 token 数量成正比,大多数现有视觉 Transformer (ViT) 在 TensorRT 和 CoreML 等传统 CNN 表现出色的实际工业部署场景中面临高效性能的挑战。尽管近期有一些设计 CNN-Transformer 混合架构的尝试来解决此问题,但其整体性能未达预期。为应对这些挑战,我们提出了一种名为 FMViT 的高效混合 ViT 架构。该方法通过混合具有不同频率的高频特征和低频特征来增强模型的表达能力,使其能有效捕获局部和全局信息。此外,我们引入了部署友好机制,如卷积多组重参数化 (gMLP)、轻量多头自注意力 (RLMHSA) 和卷积融合块 (CFB),以进一步提升模型性能并降低计算开销。我们的实验表明,FMViT 在各种视觉任务的延迟/精度权衡上超越了现有 CNN、ViT 和 CNN-Transformer 混合架构。在 TensorRT 平台上,FMViT 在 ImageNet 数据集上以 top-1 精度比 Resnet101 高出 2.5% (83.3% 对 80.8%),同时保持相似的推理延迟。此外,FMViT 取得了与 EfficientNet-B5 相当的性能,但推理速度提升 43%。在 CoreML 上,FMViT 在 ImageNet 数据集上以 top-1 精度比 MobileOne 高出 2.6% (78.5% 对 75.9%),推理延迟与 MobileOne 相当。我们的代码可在 https://github.com/tany0699/FMViT 找到。

关键词

引用

@article{arxiv.2311.05707,
  title  = {FMViT: A multiple-frequency mixing Vision Transformer},
  author = {Wei Tan and Yifeng Geng and Xuansong Xie},
  journal= {arXiv preprint arXiv:2311.05707},
  year   = {2023}
}