使用后训练量化实现LLM的二值权重与激活
机器学习
2025-07-01 v3 人工智能
摘要
将大型语言模型(LLM)量化到1位精度可显著降低计算成本, 但现有量化技术在权重和激活精度低于4位(W4A4)时会出现明显性能下降。本文提出了一种后训练量化框架, 采用W(1+1)A(1*4)配置, 其中权重量化为1位, 加上细粒分组的1位;激活量化为1位, 通道数提高4倍。对于权重量化, 我们提出利用赤希曼(Hessian)感知的细粒分组结合EM基于量化方案。对于激活量化, 我们将INT4量化后的激活分解为等效的4乘INT1格式, 并同时平滑缩放因子基于量化误差, 从而进一步降低激活量化误差。我们的方法在W2A4配置下超越了多个任务上的最先进(SOTA) LLM量化基线, 将现有LLM量化方法的边界推向完全二值化模型。代码已公开于https://github.com/JimmyCrave/LLM-PTQ-binarization。
引用
@article{arxiv.2504.05352,
title = {Achieving binary weight and activation for LLMs using Post-Training Quantization},
author = {Siqing Song and Chuang Wang and Ruiqi Wang and Yi Yang and Xu-Yao Zhang},
journal= {arXiv preprint arXiv:2504.05352},
year = {2025}
}