当平坦极小值失效时:FP32 收敛后 INT4 量化崩溃的特征化
机器学习
2026-04-17 v1
摘要
训练后量化(PTQ)假设一个良好收敛的模型就是一个准备好量化的模型。我们表明,这一假设以一种结构化、可测量且此前未被特征化的方式失效。使用一个无校准的逐组 INT4 探针,应用于所有 154 个公开可用的 Pythia-160m 训练检查点,我们识别出一个三阶段发散结构:一个快速学习阶段,其中 FP32 困惑度和量化鲁棒性同时提升;一个持续约 70,000 步的亚稳态平台期,其中 FP32 困惑度停滞但 INT4 差距保持有界;以及一个爆炸性发散阶段,其中 INT4 差距从 11% 累积到 517%,而 FP32 困惑度几乎不变。关键的是,这种发散并非始于学习率开始衰减时,而是精确地始于 FP32 困惑度收敛时——一个更细粒度的起始预测因子,这意味着收敛后的权重更新(而非衰减幅度本身)是直接原因。我们进一步表明,INT8 量化在整个三个阶段完全不受影响,将机制限制在 16 级 INT4 网格的粗糙度上,并通过直接的峰度测量排除了权重异常值累积作为机制的可能性。最后,我们从发散前的检查点进行了一个受控的分支实验,在九个独立运行中比较了三种学习率调度(余弦延续、SGDR 热重启和我们提出的振荡锁定)。SGDR 均匀地加速了发散(对余弦的成对胜率为 0/9),而 OLI 的稳定冷却阶段平均将 INT4 差距降低了 2.2 个百分点(t = -5.46, p < 0.0001),这表明调度幅度校准(而非单纯的振荡)决定了扰动是有益还是有害。我们的代码、探针实现以及所有 154 个检查点的审计结果均已公开发布。
引用
@article{arxiv.2604.15167,
title = {When Flat Minima Fail: Characterizing INT4 Quantization Collapse After FP32 Convergence},
author = {Marcus Armstrong},
journal= {arXiv preprint arXiv:2604.15167},
year = {2026}
}