HAWQ-V2:基于 Hessian 迹加权的神经网络量化
计算机视觉与模式识别
2021-05-11 v1
摘要
量化是减小神经网络内存占用与推理时间的有效方法,例如在云端尤其是边缘端的高效推理。然而,超低精度量化可能导致模型泛化能力显著下降。一个有前景的解决方案是混合精度量化,即将更敏感的层保持在较高精度。但混合精度量化的搜索空间随层数呈指数增长。近期工作提出 HAWQ,一种新颖的基于 Hessian 的框架,旨在利用二阶信息缩减该指数搜索空间。尽管有前景,该先前工作存在三大局限:(i)HAWQV1 仅使用 Hessian 最大特征值作为敏感度度量,未考虑 Hessian 谱的其余部分;(ii)HAWQV1 方法仅提供不同层的相对敏感度,因此需手动选择混合精度设置;(iii)HAWQV1 未考虑混合精度激活量化。本文提出 HAWQV2 以克服这些不足。针对(i),我们给出理论分析表明更好的敏感度度量是计算所有 Hessian 特征值的平均值。针对(ii),我们开发了基于帕累托前沿的方法,无需手动选择即可确定各层的精确比特精度。针对(iii),我们将 Hessian 分析扩展至混合精度激活量化。我们发现这对目标检测极为有益。我们展示 HAWQV2 在广泛任务上取得了新的 SOTA 结果。
引用
@article{arxiv.1911.03852,
title = {HAWQ-V2: Hessian Aware trace-Weighted Quantization of Neural Networks},
author = {Zhen Dong and Zhewei Yao and Yaohui Cai and Daiyaan Arfeen and Amir Gholami and Michael W. Mahoney and Kurt Keutzer},
journal= {arXiv preprint arXiv:1911.03852},
year = {2021}
}