PikeLPN:缓解低精度神经网络中被忽视的低效问题
机器学习
2024-04-02 v1 计算机视觉与模式识别
摘要
低精度量化在神经网络优化中因其有效性而受到认可。我们的分析揭示,在参数化激活函数、批归一化和量化缩放等层中普遍存在的非量化逐元素操作主导了低精度模型的推理成本。这些非量化逐元素操作在SOTA效率指标(如算术计算工作量ACE)中常被忽视。本文提出ACEv2——ACE的扩展版本,能更好地与量化模型的推理成本及其在ML硬件上的能耗对齐。此外,我们引入PikeLPN,该模型通过对逐元素操作和乘加操作均应用量化来解决这些效率问题。特别地,我们提出一种名为QuantNorm的批归一化层新型量化技术,允许量化批归一化参数而不损害模型性能。此外,我们提出应用双量化,即量化缩放参数被量化。进一步,我们通过引入分布异构量化来识别并解决可分离卷积层中的分布不匹配问题,使其能够量化为低精度。PikeLPN在效率-精度权衡中实现了帕累托最优,与SOTA低精度模型相比效率提升高达3倍。
引用
@article{arxiv.2404.00103,
title = {PikeLPN: Mitigating Overlooked Inefficiencies of Low-Precision Neural Networks},
author = {Marina Neseem and Conor McCullough and Randy Hsin and Chas Leichner and Shan Li and In Suk Chong and Andrew G. Howard and Lukasz Lew and Sherief Reda and Ville-Mikko Rautio and Daniele Moro},
journal= {arXiv preprint arXiv:2404.00103},
year = {2024}
}
备注
Accepted in CVPR 2024. 10 Figures, 9 Tables