PQS(修剪、量化与排序):神经网络计算中点积积累的低位宽方法
机器学习
2025-04-15 v1 人工智能
摘要
我们提出了 PQS 方法,通过三种技术(修剪、量化与排序)实现神经网络计算中点积的低位宽累积。在常规量化(例如 8 位)点积中,部分结果会累积到宽的(例如 32 位)累加器中,以避免累积中间部分和时出现溢出。然而,这些宽的累加器会增加内存带宽使用并降低能源效率。我们表明,经过浮点迭代 N:M 修剪后量化为 8(或更少)位,并以“从小到大”的排序顺序累积部分乘积,可实现准确的压缩模型,其点积长度为短,不需要宽的累加器。我们设计、分析并实现了 PQS 算法,以在推理阶段消除累积溢出。该方法在多个图像分类任务中实现了与浮点基线相当的模型精度,同时将累加器位宽降低 2.5 倍。
引用
@article{arxiv.2504.09064,
title = {PQS (Prune, Quantize, and Sort): Low-Bitwidth Accumulation of Dot Products in Neural Network Computations},
author = {Vikas Natesh and H. T. Kung},
journal= {arXiv preprint arXiv:2504.09064},
year = {2025}
}