MPTQ-ViT:面向视觉Transformer的混合精度训练后量化
计算机视觉与模式识别
2024-02-02 v2
摘要
尽管视觉Transformer(ViT)在计算机视觉任务中展现出巨大潜力,但其高昂的计算和内存需求给实际应用带来了挑战。现有的训练后量化方法利用数值重分布或专用量化器来处理ViT中的非正态分布。然而,由于未考虑激活值的不对称性并依赖人工设定,这些方法在低位量化下往往难以维持性能。为克服这些挑战,我们引入了带偏置项的SmoothQuant(SQ-b)以缓解不对称问题并减少钳位损失。我们还引入了最优缩放因子比率搜索(OPT-m),通过数据驱动机制自动确定量化参数。为进一步提升可压缩性,我们整合了上述技术,提出了一个面向视觉Transformer的混合精度训练后量化框架(MPTQ-ViT)。我们开发了贪婪混合精度量化(Greedy MP)方法,在考虑模型性能和可压缩性的同时分配逐层位宽。我们在ViT、DeiT和Swin上的实验表明,在ImageNet数据集上,与SOTA方法相比,精度有显著提升。具体而言,我们提出的方法在4位单精度ViT上实现了0.90%至23.35%的精度提升,在5位混合精度全量化ViT上实现了3.82%至78.14%的精度提升。
引用
@article{arxiv.2401.14895,
title = {MPTQ-ViT: Mixed-Precision Post-Training Quantization for Vision Transformer},
author = {Yu-Shan Tai and An-Yeu and Wu},
journal= {arXiv preprint arXiv:2401.14895},
year = {2024}
}