中文

Mobile-Former:连接 MobileNet 与 Transformer

计算机视觉与模式识别 2022-03-04 v3 机器学习

摘要

我们提出 Mobile-Former,一种 MobileNet 与 transformer 的并行设计,二者之间带有双向桥接。该结构利用了 MobileNet 在局部处理与 transformer 在全局交互上的优势,而桥接实现了局部与全局特征的双向融合。与近期视觉 transformer 的工作不同,Mobile-Former 中的 transformer 仅含极少令牌(如 6 个或更少),随机初始化以学习全局先验,从而计算成本很低。结合所提出的轻量交叉注意力来建模桥接,Mobile-Former 不仅计算高效,且具更强表征能力。在 ImageNet 分类上 25M 到 500M FLOPs 的低 FLOP 区间,它优于 MobileNetV3。例如,Mobile-Former 在 294M FLOPs 下达到 77.9\% 的 top-1 准确率,较 MobileNetV3 提升 1.3\% 且节省 17\% 计算量。迁移至目标检测时,在 RetinaNet 框架下 Mobile-Former 以 8.6 AP 优于 MobileNetV3。此外,我们用 Mobile-Former 替换 DETR 中的骨干、编码器与解码器,构建了高效的端到端检测器,其以 1.1 AP 优于 DETR,同时节省 52\% 计算成本与 36\% 参数量。

关键词

引用

@article{arxiv.2108.05895,
  title  = {Mobile-Former: Bridging MobileNet and Transformer},
  author = {Yinpeng Chen and Xiyang Dai and Dongdong Chen and Mengchen Liu and Xiaoyi Dong and Lu Yuan and Zicheng Liu},
  journal= {arXiv preprint arXiv:2108.05895},
  year   = {2022}
}

备注

To Appear at CVPR 2022