用于训练后量化的注意力舍入
机器学习
2022-07-08 v1 人工智能
摘要
目前,神经网络模型的量化方法主要分为训练后量化(PTQ)和量化感知训练(QAT)。训练后量化仅需一小部分数据即可完成量化过程,但其量化模型的性能不如量化感知训练。本文提出了一种名为 Attention Round 的新颖量化方法。该方法在量化过程中使参数 w 有机会映射到所有可能的量化值,而不仅仅是 w 附近的两个量化值。被映射到不同量化值的概率与量化值和 w 之间的距离呈负相关,并以高斯函数衰减。此外,本文使用有损编码长度作为度量来为模型的不同层分配位宽,以解决混合精度量化问题,从而有效避免了求解组合优化问题。本文还在不同模型上进行了量化实验,结果证实了所提方法的有效性。对于 ResNet18 和 MobileNetV2,本文提出的训练后量化仅需 1,024 个训练数据和 10 分钟即可完成量化过程,并能达到与量化感知训练相当的量化性能。
引用
@article{arxiv.2207.03088,
title = {Attention Round for Post-Training Quantization},
author = {Huabin Diao and Gongyan Li and Shaoyun Xu and Yuexing Hao},
journal= {arXiv preprint arXiv:2207.03088},
year = {2022}
}
备注
18 pages, 5 figures, 5 tables