中文

近无损 HiF8 W8A8 量化感知训练的最大窗口尺度估计

机器学习 2026-05-28 v2 人工智能

摘要

低位浮点格式的量化感知训练(QAT)使大型语言模型(LLM)部署更高效,但会引入标准训练指标难以察觉的细微失效模式。我们通过延迟张量缩放(Delayed Tensor Scaling, DTS)视角,对 OpenPangu-Embedded-1B 的 HiF8 W8A8 QAT 进行系统性研究。在八项受控实验中,我们识别并分离了两种正交失效模式:(i) amax 饱和,延迟的尺度估计通过前向传播中的裁剪方式悄然损坏知识敏感表示;(ii) 灾难性遗忘,激进的学习率独立于量化方式覆盖预训练的常识知识。训练损失无法检测到这两种情况。我们采用保守的最大算法 DTS 策略处理 amax 饱和问题,该策略在 64 步历史窗口上运行;通过 500 步 BF16 预热后以 lr=10^{-5} 进行 QAT 来缓解遗忘问题。这两种修复措施既必要又充分:最终配置相对于匹配的 BF16 基线,实现仅 0.43% 的 MMLU 下降、0.58% 的 HellaSwag 下降和 0.22% 的 ARC-Challenge 下降,训练损失 APE 仅为 0.11%,在 10,000 步训练中完成。

关键词

引用

@article{arxiv.2605.26189,
  title  = {Max-Window Scale Estimation for Near-Lossless HiF8 W8A8 Quantization-Aware Training},
  author = {Yingying Cheng and Jinquan Shi and Li Zhou and Zhiyang He and Zhaoyi Sun and Fan Zhang and Jie Sun},
  journal= {arXiv preprint arXiv:2605.26189},
  year   = {2026}
}