中文

面向移动应用的视觉 Transformer:简要综述

计算机视觉与模式识别 2023-06-01 v1 人工智能

摘要

Vision Transformers (ViTs) 已在许多计算机视觉任务上展现出最先进的性能。遗憾的是,部署这些大规模 ViT 耗费资源,对许多移动设备而言难以实现。当社区多数人在构建越来越大的 ViT 时,我们提出一个完全相反的问题:在精度与推理延迟的权衡下,为使 ViT 适合移动端部署,它可以做到多小?我们考察了几种专为移动应用设计的 ViT,观察到它们修改了 transformer 的架构,或是围绕 CNN 与 transformer 的组合构建。近期工作也尝试创建稀疏 ViT 网络并提出注意力模块的替代方案。本文中,我们研究这些架构,识别挑战并分析究竟是什么让视觉 transformer 适合移动应用。我们旨在作为未来研究方向的基线,并希望为在移动设备上运行的应用选择典范视觉 transformer 架构奠定基础。

关键词

引用

@article{arxiv.2305.19365,
  title  = {Vision Transformers for Mobile Applications: A Short Survey},
  author = {Nahid Alam and Steven Kolawole and Simardeep Sethi and Nishant Bansali and Karina Nguyen},
  journal= {arXiv preprint arXiv:2305.19365},
  year   = {2023}
}