中文

能效高效、无量化反向的 Q-LLM:基于脉冲神经网络的显著值消除方法

机器学习 2025-10-23 v1

摘要

在大型语言模型(LLM)时代,权重-激活量化有助于通过降低内存和计算位宽来将模型置于边缘设备。然而,对于受能源约束的硬件,仍存在以下三个挑战:(1)即使在量化后,乘加(MAC)运算仍不可避免,且继续占据能源消耗的主导地位;(2)量化反向(或逐张量/通道缩放)引入额外的算术运算和数据移动,增加延迟和能源消耗;(3)统一的参数位宽会裁剪显著值——而在当前矩阵硬件和内存上, intra-channel 混合精度通常不可行。相反,受大脑启发的脉冲神经网络(SNN)由于其基于脉冲的二进制信息表示和积分-发放(IF)范式,天然支持混合精度存储和能效计算,通过用时序累加(ACC)取代复杂的 MAC 操作。基于此特性,我们提出了 SpikeQuant 方法,通过选择性地对具有显著值的激活进行混合精度量化,并将其重新编码为二进制脉冲计数,从而实现不同位宽的动态混合存储。此外,通过将量化比例嵌入 IF 机制的阈值中,我们的方法在处理权重和激活时实现能效高效的线性变换,同时避免显式的量化反向。实验结果表明,SpikeQuant 在 W4A4 量化下始终能够实现接近 FP16 的困惑度(perplexity),且相较于现有方法可降低最高 4.6 倍的能源消耗,凸显其在准确能效 LLM 部署方面的有效性。

关键词

引用

@article{arxiv.2510.19498,
  title  = {Energy-Efficient and Dequantization-Free Q-LLMs: A Spiking Neural Network Approach to Salient Value Mitigation},
  author = {Chenyu Wang and Zhanglu Yan and Zhi Zhou and Xu Chen and Weng-Fai Wong},
  journal= {arXiv preprint arXiv:2510.19498},
  year   = {2025}
}