视觉Transformer的训练后量化
计算机视觉与模式识别
2021-06-29 v1
摘要
近来,transformer 在多种计算机视觉应用中取得了卓越性能。相较于主流卷积神经网络,视觉 transformers 常具有复杂架构以提取强大特征表示,更难以在移动设备上部署。本文提出一种有效的训练后量化(post-training quantization)算法,以降低视觉 transformers 的存储与计算开销。本质上,量化任务可视为分别为权重和输入寻找最优低比特量化区间。为保持注意力机制的功能,我们在常规量化目标中引入排序损失,旨在保持自注意力结果量化后的相对顺序。此外,我们深入分析了不同层量化损失与特征多样性之间的关系,并利用各注意力图与输出特征的核范数探索了混合精度量化方案。所提方法在多个基准模型与数据集上得到验证,优于当前最先进的训练后量化算法。例如,在 ImageNet 数据集上采用 DeiT-B 模型进行约8比特量化,可获得 81.29\% 的 top-1 准确率。
引用
@article{arxiv.2106.14156,
title = {Post-Training Quantization for Vision Transformer},
author = {Zhenhua Liu and Yunhe Wang and Kai Han and Siwei Ma and Wen Gao},
journal= {arXiv preprint arXiv:2106.14156},
year = {2021}
}