中文

边缘端的视觉Transformer:模型压缩与加速策略综合综述

计算机视觉与模式识别 2025-05-20 v3 硬件体系结构

摘要

近年来,视觉Transformer(ViT)已成为图像分类、目标检测和分割等计算机视觉任务的强大且有前景的技术。与依赖层次化特征提取的卷积神经网络(CNN)不同,ViT将图像视为补丁序列并利用自注意力机制。然而,其高计算复杂度和内存需求对资源受限的边缘设备部署构成重大挑战。为解决这些局限性,大量研究聚焦于模型压缩技术和硬件感知的加速策略。尽管如此,一项能够系统分类这些技术及其在准确性、效率和硬件适应性方面权衡的全面综述仍然缺乏。本综述通过提供对ViT模型压缩技术、边缘推理软件工具以及硬件加速策略的结构化分析来填补这一空白。我们讨论其对准确性、效率和硬件适应性的影响,突出关键挑战和新兴研究方向,以推进ViT在边缘平台(包括图形处理器GPU、专用集成电路ASIC和现场可编程门阵列FPGA)上的部署。目标是激发进一步研究,以当代指南指导优化ViT以实现边缘设备的高效部署。

关键词

引用

@article{arxiv.2503.02891,
  title  = {Vision Transformers on the Edge: A Comprehensive Survey of Model Compression and Acceleration Strategies},
  author = {Shaibal Saha and Lanyu Xu},
  journal= {arXiv preprint arXiv:2503.02891},
  year   = {2025}
}

备注

Accepted in Neurocomputing, Elsevier