中文

用于训练后量化的注意力舍入

机器学习 2022-07-08 v1 人工智能

摘要

目前,神经网络模型的量化方法主要分为训练后量化(PTQ)和量化感知训练(QAT)。训练后量化仅需一小部分数据即可完成量化过程,但其量化模型的性能不如量化感知训练。本文提出了一种名为 Attention Round 的新颖量化方法。该方法在量化过程中使参数 w 有机会映射到所有可能的量化值,而不仅仅是 w 附近的两个量化值。被映射到不同量化值的概率与量化值和 w 之间的距离呈负相关,并以高斯函数衰减。此外,本文使用有损编码长度作为度量来为模型的不同层分配位宽,以解决混合精度量化问题,从而有效避免了求解组合优化问题。本文还在不同模型上进行了量化实验,结果证实了所提方法的有效性。对于 ResNet18 和 MobileNetV2,本文提出的训练后量化仅需 1,024 个训练数据和 10 分钟即可完成量化过程,并能达到与量化感知训练相当的量化性能。

关键词

引用

@article{arxiv.2207.03088,
  title  = {Attention Round for Post-Training Quantization},
  author = {Huabin Diao and Gongyan Li and Shaoyun Xu and Yuexing Hao},
  journal= {arXiv preprint arXiv:2207.03088},
  year   = {2022}
}

备注

18 pages, 5 figures, 5 tables