中文

面向 W4A4 大语言模型量化的闭形式旋转离群值平滑

计算与语言 2025-12-01 v1

摘要

大语言模型(LLM)量化有助于在资源受限的环境中部署 LLM,但现有方法由于将不兼容的梯度优化与量化截断组合,导致收敛问题严重。这延长了量化时间并降低了 LLM 的任务性能。我们的研究确认,Stiefel 流形上的 Straight-Through Estimator(STE)引入非平滑性和梯度噪声,阻碍优化收敛,阻止高保真度量化 LLM 的开发,尽管经过大量训练。为解决上述限制,我们提出 SingleQuant——一种单 pass 量化框架,解耦于量化截断,从而消除上述非平滑性和梯度噪声因素。具体而言,SingleQuant 构建 Alignment Rotation Transformation(ART)和 Uniformity Rotation Transformation(URT),针对不同的激活离群值进行平滑和分布重塑。这两种矩阵均包含严格定义的 Givens 旋转,具有预定维度和旋转角度,使 LLM 能够在短时间内实现更好的任务性能。实验结果表明,SingleQuant 在 7B-70B LLM 上各种任务中优于所选基线。更准确地说,SingleQuant 使量化 LLM 在置信度和效率之间实现更佳平衡。例如,在量化 LLaMA-2-13B 时,SingleQuant 实现了 1,400 倍的量化加速,并将平均任务性能提升 0.57%。

关键词

引用

@article{arxiv.2511.22315,
  title  = {Named Entity Recognition for the Kurdish Sorani Language: Dataset Creation and Comparative Analysis},
  author = {Bakhtawar Abdalla and Rebwar Mala Nabi and Hassan Eshkiki and Fabio Caraffini},
  journal= {arXiv preprint arXiv:2511.22315},
  year   = {2025}
}