中文

视觉 Transformer 的块级混合精度量化

计算机视觉与模式识别 2023-05-12 v1

摘要

随着新兴硬件开始支持混合位宽算术计算,混合精度量化被广泛用于降低神经网络复杂度。然而,视觉 Transformer(ViTs)需要复杂的自注意力计算以保证强大特征表示的学习,这使得 ViTs 的混合精度量化仍具挑战性。在本文中,我们提出一种新颖的块级混合精度量化(PMQ)以实现 ViTs 的高效推理。具体而言,我们设计了一种轻量全局度量,比现有方法更快,用于衡量 ViTs 中各组件对量化误差的敏感度。此外,我们引入帕累托前沿方法根据敏感度自动分配最优位精度。为进一步降低推理阶段自注意力的计算复杂度,我们提出块级模块以重分配每层中块的位宽。在 ImageNet 数据集上的大量实验表明,我们的方法大幅降低搜索成本并促进了混合精度量化在 ViTs 上的应用。

关键词

引用

@article{arxiv.2305.06559,
  title  = {Patch-wise Mixed-Precision Quantization of Vision Transformer},
  author = {Junrui Xiao and Zhikai Li and Lianwei Yang and Qingyi Gu},
  journal= {arXiv preprint arXiv:2305.06559},
  year   = {2023}
}