EdgeNeXt:面向移动视觉应用的高效 CNN-Transformer 融合架构
计算机视觉与模式识别
2022-10-25 v3
摘要
在追求不断提高精度的过程中,通常开发出庞大而复杂的神经网络。此类模型需要大量计算资源,因此无法部署在边缘设备上。由于资源高效通用网络在多个应用领域中的实用性,构建此类网络具有重大意义。在这项工作中,我们努力有效结合 CNN 和 Transformer 模型的优势,并提出一种新的高效混合架构 EdgeNeXt。具体而言,在 EdgeNeXt 中,我们引入了拆分深度转置注意力(STDA)编码器,该编码器将输入张量拆分为多个通道组,并利用深度卷积与跨通道维度的自注意力来隐式增大感受野并编码多尺度特征。我们在分类、检测和分割任务上的大量实验揭示了所提方法的优势,以相对更低的计算需求优于最先进的方法。我们参数量为 1.3M 的 EdgeNeXt 模型在 ImageNet-1K 上达到 71.2% 的 top-1 准确率,以 28% 的 FLOPs 削减绝对超越 MobileViT 2.2%。此外,参数量为 5.6M 的 EdgeNeXt 模型在 ImageNet-1K 上达到 79.4% 的 top-1 准确率。代码和模型可在 https://t.ly/_Vu9 获取。
引用
@article{arxiv.2206.10589,
title = {EdgeNeXt: Efficiently Amalgamated CNN-Transformer Architecture for Mobile Vision Applications},
author = {Muhammad Maaz and Abdelrahman Shaker and Hisham Cholakkal and Salman Khan and Syed Waqas Zamir and Rao Muhammad Anwer and Fahad Shahbaz Khan},
journal= {arXiv preprint arXiv:2206.10589},
year = {2022}
}
备注
Accepted at ECCVW 2022 (Oral, CADL: Computational Aspects of Deep Learning)