用于改进量化感知训练的最优裁剪与幅值感知微分
机器学习
2022-06-15 v1
摘要
数据裁剪对于降低量化操作中的噪声以及提高量化感知训练(QAT)可达到的精度至关重要。当前做法依赖启发式方法设定裁剪阈值标量,且无法证明是最优的。我们提出最优裁剪张量与向量(OCTAV),一种递归算法以确定 MSE 最优裁剪标量。OCTAV 由快速 Newton-Raphson 方法导出,在 QAT 流程的每一次迭代中、针对每个张量实时寻找最优裁剪标量。因此,QAT 算法在每一步均以可证明的最小量化噪声构建。此外,我们揭示了 QAT 中常见梯度估计技术的局限,并提出幅值感知微分作为进一步改善精度的补救方法。实验上,启用 OCTAV 的 QAT 在多项任务上达到最先进精度。包括在 ImageNet 上从头训练及重训练 ResNets 和 MobileNets,以及使用 BERT 模型进行 Squad 微调,其中启用 OCTAV 的 QAT 在低位宽(4 至 6 比特)下一致地保持精度。我们的结果无需对基线训练方案做任何修改,仅在适当位置插入量化操作即可。
引用
@article{arxiv.2206.06501,
title = {Optimal Clipping and Magnitude-aware Differentiation for Improved Quantization-aware Training},
author = {Charbel Sakr and Steve Dai and Rangharajan Venkatesan and Brian Zimmer and William J. Dally and Brucek Khailany},
journal= {arXiv preprint arXiv:2206.06501},
year = {2022}
}
备注
Published as a spotlight paper at ICML 2022. Paper contains 16 pages, 5 figures, and 6 tables