利用层间依赖增强 Hessian 的混合精度训练后量化方法
机器学习
2023-06-09 v1
摘要
由于模型复杂度和参数量的不断增加,以低延迟高效部署神经网络模型变得愈发具有挑战性。模型量化提供了一种同时减少内存占用和计算需求的解决方案。然而,由于模型中不同层对数值误差的敏感度存在差异,激进的量化可能导致模型精度出现不可接受的损失。为应对这一挑战,我们提出了一种混合精度训练后量化(PTQ)方法,该方法根据网络中张量的具体需求为其分配不同的数值精度,从而在保持模型精度的同时减少内存占用并改善延迟。先前的工作依赖逐层 Hessian 信息来确定数值精度,但正如我们所展示的,Hessian 估计通常不足以确定层敏感度的有效排序。我们通过用额外信息增强估计的 Hessian 以捕获层间依赖来解决此问题。我们证明,这在多个模型上沿精度-延迟 Pareto 前沿一致地改善了 PTQ 性能。我们的方法结合二阶信息和层间依赖来引导二分搜索,在用户可配置的模型精度退化范围内寻找量化配置。我们在 ResNet50、MobileNetV2 和 BERT 模型上评估了方法的有效性。我们的实验表明,与 16 位基线相比,延迟分别降低了 、 和 ,同时将模型精度保持在基线的 以内。
引用
@article{arxiv.2306.04879,
title = {Augmenting Hessians with Inter-Layer Dependencies for Mixed-Precision Post-Training Quantization},
author = {Clemens JS Schaefer and Navid Lambert-Shirzad and Xiaofan Zhang and Chiachen Chou and Tom Jablin and Jian Li and Elfie Guo and Caitlin Stanton and Siddharth Joshi and Yu Emma Wang},
journal= {arXiv preprint arXiv:2306.04879},
year = {2023}
}