中文

EdgeViTs:在移动设备上以视觉 Transformer 媲美轻量级 CNN

计算机视觉与模式识别 2022-07-25 v2

摘要

基于自注意力的模型如视觉 Transformer(ViTs)已成为计算机视觉中卷积神经网络(CNNs)极具竞争力的架构替代方案。尽管出现了识别精度不断提高的更强变体,但由于自注意力的二次复杂度,现有 ViTs 通常在计算和模型规模上需求较高。尽管先前 CNN 的若干成功设计选择(例如卷积与分层多阶段结构)已被重新引入近期 ViTs,仍不足以满足移动设备的有限资源要求。这促使了最近基于最先进 MobileNet-v2 开发轻量 ViTs 的尝试,但仍留下性能差距。在本工作中,沿这一研究不足的方向进一步推进,我们引入 EdgeViTs,一个新的轻量 ViT 系列,首次使基于注意力的视觉模型在精度与设备端效率的权衡上能与最佳轻量级 CNN 竞争。这是通过基于自注意力与卷积的最优融合引入高度高效的局部-全局-局部(LGL)信息交换瓶颈实现的。针对设备专用评估,我们采用直接关注设备端延迟并首次关注能效的实际方法,而非依赖 FLOPs 数量或参数等不精确代理。具体而言,我们表明当同时考虑精度-延迟与精度-能量权衡时,我们的模型是帕累托最优的,在几乎所有情况下对其它 ViTs 实现严格支配,并与最高效的 CNNs 竞争。代码见 https://github.com/saic-fi/edgevit。

关键词

引用

@article{arxiv.2205.03436,
  title  = {EdgeViTs: Competing Light-weight CNNs on Mobile Devices with Vision Transformers},
  author = {Junting Pan and Adrian Bulat and Fuwen Tan and Xiatian Zhu and Lukasz Dudziak and Hongsheng Li and Georgios Tzimiropoulos and Brais Martinez},
  journal= {arXiv preprint arXiv:2205.03436},
  year   = {2022}
}

备注

Accepted in ECCV 2022