中文

PQV-Mobile:一种联合剪枝与量化的工具包,用于优化视觉Transformer在移动应用中的部署

计算机视觉与模式识别 2024-08-19 v1 人工智能

摘要

视觉Transformer(ViTs)在计算机视觉任务中极为有效,正在取代卷积神经网络成为新的最先进方法,但它们是复杂且内存密集型的模型。为了在资源受限的移动/边缘系统上有效运行这些模型,不仅需要压缩这些模型,还需要优化它们并将其转换为部署友好的格式。为此,本文提出了一种联合剪枝与量化的工具 PQV-Mobile,用于优化视觉Transformer以适用于移动应用。该工具支持基于幅度重要性、Taylor 重要性和Hessian重要性的多种结构化剪枝类型。它还支持从 FP32 到 FP16 和 int8 的量化,针对不同的移动硬件后端。我们展示了该工具的能力,并针对不同剪枝量和 int8 量化展示了重要的延迟-内存-精度权衡。使用 Facebook 数据高效图像Transformer(DeiT)模型进行实验的结果表明,即使仅对 DeiT 模型进行 9.375% 的剪枝并从 FP32 量化到 int8,再经过移动应用优化,我们仍实现了 7.18 倍的延迟降低,且精度损失仅为 2.24%。该工具是开源的。

关键词

引用

@article{arxiv.2408.08437,
  title  = {PQV-Mobile: A Combined Pruning and Quantization Toolkit to Optimize Vision Transformers for Mobile Applications},
  author = {Kshitij Bhardwaj},
  journal= {arXiv preprint arXiv:2408.08437},
  year   = {2024}
}