中文

MobileViT:轻量、通用且移动端友好的视觉Transformer

计算机视觉与模式识别 2022-03-07 v2 人工智能 机器学习

摘要

轻量卷积神经网络(CNN)是移动视觉任务的事实标准。其空间归纳偏置使其能以更少参数在不同视觉任务中学习表征。然而,这些网络在空间上是局部的。为学习全局表征,基于自注意力的视觉Transformer(ViT)被采用。与CNN不同,ViT是重量级的。本文中,我们提出如下问题:是否可能结合CNN与ViT的优势,构建用于移动视觉任务的轻量且低延迟网络?为此,我们引入MobileViT,一种面向移动设备的轻量通用视觉Transformer。MobileViT以不同视角看待Transformer的全局信息处理,即把Transformer当作卷积。我们的结果表明,MobileViT在不同任务和数据集上显著优于基于CNN和ViT的网络。在ImageNet-1k数据集上,MobileViT以约600万参数取得78.4%的top-1准确率,在相似参数量下比MobileNetv3(基于CNN)和DeIT(基于ViT)分别高3.2%和6.2%。在MS-COCO目标检测任务上,MobileViT在相似参数量下比MobileNetv3准确5.7%。我们的源代码已开源,详见:https://github.com/apple/ml-cvnets

关键词

引用

@article{arxiv.2110.02178,
  title  = {MobileViT: Light-weight, General-purpose, and Mobile-friendly Vision Transformer},
  author = {Sachin Mehta and Mohammad Rastegari},
  journal= {arXiv preprint arXiv:2110.02178},
  year   = {2022}
}

备注

Accepted at ICLR'22