中文

视觉 Transformer 模型压缩与加速综述

计算机视觉与模式识别 2024-04-17 v1

摘要

视觉 Transformer (ViT) 标志着计算机视觉领域的范式转变,在多种任务中超越了最先进的模型。然而,其实际部署受到高计算和内存需求的阻碍。本研究通过评估四种主要的模型压缩技术来应对这一挑战:量化、低秩近似、知识蒸馏和剪枝。我们系统地分析并比较了这些技术及其组合在资源受限环境下优化 ViT 的效能。全面的实验评估表明,这些方法有助于在模型准确率和计算效率之间取得平衡,为其在边缘计算设备中的更广泛应用铺平了道路。

关键词

引用

@article{arxiv.2404.10407,
  title  = {Comprehensive Survey of Model Compression and Speed up for Vision Transformers},
  author = {Feiyang Chen and Ziqian Luo and Lisang Zhou and Xueting Pan and Ying Jiang},
  journal= {arXiv preprint arXiv:2404.10407},
  year   = {2024}
}