中文

HESTIA:一种基于 Hessian 指导的极低位 QAT 框架用于超大语言模型

机器学习 2026-01-29 v1 人工智能

摘要

随着大语言模型(LLM)的规模不断扩大,部署受内存瓶颈日益制约,推动了向极低位量化的转变。然而,大多数量化感知训练(QAT)方法都从训练初期就应用硬取整和直通估计器(STE),这会过早离散化优化景观,导致潜在权重与量化权重之间持续的梯度不匹配,阻碍对量化模型的有效优化。为此,我们提出了 Hestia,一种基于 Hessian 指导的极低位 QAT 框架,取代刚性阶跃函数,采用受温度控制的softmax松弛以保持训练初期的梯度流动,同时逐步加硬化量化。此外,Hestia 利用张量级 Hessian 迹度量作为轻量曲率信号,以驱动精细的温度退火,实现模型中各参数的灵敏度感知离散化。在 Llama-3.2 上的评估表明,Hestia 在所有基准上均优于现有的三值 QAT 方法,为 1B 和 3B 模型分别实现了平均零样本提升 5.39% 和 4.34%。这些结果表明,Hessian 指导的松弛有效恢复了表示能力,为 1.58 位 LLM 的训练建立了更稳健的路径。代码已公开于 https://github.com/hestia2026/Hestia。

关键词

引用

@article{arxiv.2601.20745,
  title  = {HESTIA: A Hessian-Guided Differentiable Quantization-Aware Training Framework for Extremely Low-Bit LLMs},
  author = {Guoan Wang and Feiyu Wang and Zongwei Lv and Yikun Zong and Tong Yang},
  journal= {arXiv preprint arXiv:2601.20745},
  year   = {2026}
}

备注

13 pages, 2 figures