面向完全量化 Vision Transformer 的 Power-of-Two 后训练量化与加速
摘要
Vision Transformers (ViTs) 在计算机视觉任务中表现出色,但因占用大量内存和计算资源,难以部署到资源受限的设备上。为此,先前的工作探索了针对 ViT 的量化算法,但仍保留浮点标度因子,导致不可忽视的再量化开销,限制了 ViT 的硬件效率,进而催生了更具硬件友好性的解决方案。为此,我们提出了\emph{P-ViT},即首个\underline{P}ower-of-Two (PoT) \underline{p}ost-training 量化与加速框架,用于加速完全量化后的 ViTs。具体而言,{关于量化,我们}探索了专门的量化方案,以有效对 ViTs 进行 PoT 标度因子的量化,从而最小化再量化开销。进一步,我们提出了粗到细的自动混合精度量化,以实现更好的精度-效率权衡。{在硬件方面,我们}开发了{dedicated chunk-based 加速器}, featuring multiple tailored sub-processors to individually handle ViTs 的不同类型的操作,缓解了可重构开销。此外,我们设计了{量身定制的行 stationary 数据流},以抓住 PoT 标度因子引入的流水线处理机会,从而提升吞吐量。大量实验一致验证了 P-ViT 的有效性。{特别地,我们在与保留浮点标度因子的对应方法相比,运用 PoT 标度因子可实现相当甚至更好的量化性能。此外,我们相较于 GPU 的 Turing Tensor Cores 实现了最高达到 的加速和 的能耗节省,相较于 SOTA 量化-based ViT 加速器实现了最高 的计算利用效率提升。代码已公开 available at \url{https://github.com/shihuihong214/P2-ViT}。
引用
@article{arxiv.2405.19915,
title = {P$^2$-ViT: Power-of-Two Post-Training Quantization and Acceleration for Fully Quantized Vision Transformer},
author = {Huihong Shi and Xin Cheng and Wendong Mao and Zhongfeng Wang},
journal= {arXiv preprint arXiv:2405.19915},
year = {2024}
}