RepViT:从 ViT 视角重审移动端 CNN
计算机视觉与模式识别
2024-03-15 v8
摘要
近来,在资源受限的移动设备上,轻量 Vision Transformers (ViTs) 相比轻量卷积神经网络 (CNNs) 展现出更优性能与更低延迟。研究者已发现轻量 ViTs 与轻量 CNNs 间的诸多结构关联。然而,二者在块结构、宏观与微观设计上的显著架构差异尚未得到充分审视。本研究从 ViT 视角重审轻量 CNN 的高效设计,并强调其在移动设备上的良好前景。具体而言,我们通过融入轻量 ViTs 的高效架构设计,逐步增强标准轻量 CNN(即 MobileNetV3)的移动友好性。由此得到一系列纯轻量 CNN 新族,称为 RepViT。大量实验表明,RepViT 优于现有最先进轻量 ViTs,并在多种视觉任务中展现出有利延迟。值得注意的是,在 ImageNet 上,RepViT 在 iPhone 12 上以 1.0 ms 延迟取得超过 80\% 的 top-1 准确率,据我们所知这是轻量模型首次达成。此外,当 RepViT 遇上 SAM,我们的 RepViT-SAM 可实现比先进 MobileSAM 近 10 更快的推理。代码与模型见 \url{https://github.com/THU-MIG/RepViT}。
引用
@article{arxiv.2307.09283,
title = {RepViT: Revisiting Mobile CNN From ViT Perspective},
author = {Ao Wang and Hui Chen and Zijia Lin and Jungong Han and Guiguang Ding},
journal= {arXiv preprint arXiv:2307.09283},
year = {2024}
}
备注
CVPR 2024 Camera-ready Version