面向移动应用的视觉 Transformer:简要综述
计算机视觉与模式识别
2023-06-01 v1 人工智能
摘要
Vision Transformers (ViTs) 已在许多计算机视觉任务上展现出最先进的性能。遗憾的是,部署这些大规模 ViT 耗费资源,对许多移动设备而言难以实现。当社区多数人在构建越来越大的 ViT 时,我们提出一个完全相反的问题:在精度与推理延迟的权衡下,为使 ViT 适合移动端部署,它可以做到多小?我们考察了几种专为移动应用设计的 ViT,观察到它们修改了 transformer 的架构,或是围绕 CNN 与 transformer 的组合构建。近期工作也尝试创建稀疏 ViT 网络并提出注意力模块的替代方案。本文中,我们研究这些架构,识别挑战并分析究竟是什么让视觉 transformer 适合移动应用。我们旨在作为未来研究方向的基线,并希望为在移动设备上运行的应用选择典范视觉 transformer 架构奠定基础。
引用
@article{arxiv.2305.19365,
title = {Vision Transformers for Mobile Applications: A Short Survey},
author = {Nahid Alam and Steven Kolawole and Simardeep Sethi and Nishant Bansali and Karina Nguyen},
journal= {arXiv preprint arXiv:2305.19365},
year = {2023}
}