视觉 Transformer 模型压缩与加速综述
计算机视觉与模式识别
2024-04-17 v1
摘要
视觉 Transformer (ViT) 标志着计算机视觉领域的范式转变,在多种任务中超越了最先进的模型。然而,其实际部署受到高计算和内存需求的阻碍。本研究通过评估四种主要的模型压缩技术来应对这一挑战:量化、低秩近似、知识蒸馏和剪枝。我们系统地分析并比较了这些技术及其组合在资源受限环境下优化 ViT 的效能。全面的实验评估表明,这些方法有助于在模型准确率和计算效率之间取得平衡,为其在边缘计算设备中的更广泛应用铺平了道路。
引用
@article{arxiv.2404.10407,
title = {Comprehensive Survey of Model Compression and Speed up for Vision Transformers},
author = {Feiyang Chen and Ziqian Luo and Lisang Zhou and Xueting Pan and Ying Jiang},
journal= {arXiv preprint arXiv:2404.10407},
year = {2024}
}