SASQ:面向大语言模型的静态激活缩放量化感知训练
计算与语言
2025-12-17 v1 人工智能
摘要
大语言模型 (LLM) 在自然语言任务中表现卓越,但因规模持续增长超出 GPU 内存 advancement 的限制,面临部署挑战。模型量化通过降低权重和激活的精度来缓解这一问题,但现有解决方案面临根本性权衡:动态量化产生高计算开销并在边缘设备上存在部署挑战,而静态量化则牺牲精度。现有量化感知训练 (QAT) 方法进一步因权重训练成本而受限。我们提出 SASQ:一个专为激活量化因子设计的轻量级 QAT 框架。SASQ 仅优化量化因子(而不改变预训练权重),实现高精度的静态推断,同时保持部署效率。SASQ 通过自适应截断部分离群值,从而降低量化难度,同时保持激活分布特征。SASQ 不仅超越了现有 SOTA 量化方案,也优于相应的 FP16 模型。在 LLaMA2-7B 上,其在 WikiText2 上的 perplexity 比 QuaRot 低 5.2%,比 FP16 模型低 4.7%。
关键词
引用
@article{arxiv.2512.14481,
title = {SASQ: Static Activation Scaling for Quantization-Aware Training in Large Language Models},
author = {Shizhuo Mao and Song Chen and Yi Kang},
journal= {arXiv preprint arXiv:2512.14481},
year = {2025}
}