SplitQuant:用于低位神经网络量化的层分割
机器学习
2025-02-07 v2 人工智能
摘要
神经网络(DNN)的量化是将DNN的参数值从原始数据类型映射到其他较低精度数据类型的过程,以减少模型大小并加快推理速度。量化通常因原始值的范围大于量化后值的范围而将不同的原始值映射到单个量化值,这会导致量化后DNN的准确率下降。离群值是量化分辨率下降的主要原因,因为其扩大了原始值的范围。为解决此问题,常用百分位数方法裁剪离群值。但裁剪离群值会导致重要且强信号被移除的问题。本文提出SplitQuant以保留离群值,同时提高量化分辨率。SplitQuant通过将每个可量化层分割为三个在数学上等价的层并施加不同的缩放因子,从而缩小原始值的范围并减轻离群值的影响。特别地,对权重和偏置进行聚类,分为低、中、上三个簇以实现优化分割。通过对DNN进行SplitQuant预处理,量化算法可获得更好结果。将SplitQuant应用于两个BERT-Tiny模型,INT2量化准确率分别提高了3.3%p和2.1%p,达到与原始FP32模型相当的准确率。
引用
@article{arxiv.2501.12428,
title = {SplitQuant: Layer Splitting for Low-Bit Neural Network Quantization},
author = {Jaewoo Song and Fangzhen Lin},
journal= {arXiv preprint arXiv:2501.12428},
year = {2025}
}
备注
Accepted as a full paper by the 2025 EDGE AI FOUNDATION Austin