Sub-100M 量化感知训练中学习率计划与位宽边界的映射
摘要
我们测试了在初始权重量化感知训练(QAT)中,次优 100M 解码器语言模型的最佳学习率计划是否取决于位宽。Phase 2 中的 720 次实验遍历了位宽 × 冷却比例 × 学习率大小 × 模型规模 × 随机种子(FP16/INT8/INT6,15M-100M,5 个随机种子),发现最佳冷却比例在每个(位宽、规模)单元格中均为 33%。主要假设——即 INT6 QAT 需要不同的计划才能胜于高精度训练——在 FP16/INT8/INT6 上被推翻。Phase 5 中的 625 次实验沿五个轴进行探索:优化器(AdamW)、计划形状(余弦)、训练长度(最长达 9 倍迭代次数)、扩展规模扫描(5M-350M)以及 INT4 从 3M 到 100M 的 INT4 扫描。空假设在所有三种设置变更下均保持稳健。在 Phase 2 上拟合的 INT6 罚函数遵循对数线性比例尺,其预测的 Phase 5 规模(5M、8M、175M、250M、350M)均在 95% 预测区间内。对于 INT4 来说,情况比更高精度更清晰:在 50M 和 100M,wd33 明显最优(配对 z 值约 12-15,10/10 个随机种子);低于 50M 时,跨 3M 到 30M 的六个规模中,没有单个规模显示出统计显著的计划偏好,每个规模的平均罚函数在随机种子水平噪声内振荡。因此,边界是低于 50M 处噪声主导区间与 50M 及以上处明确的 wd33 区间之间的转变,而非干净的 wd10 区域。权重到网格距离探针推翻了 FP16/INT8/INT6 空结果的最简单机制(快速网格捕获):在冷却前,INT6-QAT 权重与 FP16 权重相距 INT6 网格的距离几乎相同(比值约 1.04)。实用建议:在亚 100M 规模时,在 FP16 上调度一次学习率计划,然后直接应用于 INT8/INT6 QAT;对于 50M 及以上的 INT4 使用 wd33;对于 50M 以下的 INT4,计划选择处于噪声中。
引用
@article{arxiv.2605.25966,
title = {Mapping the Schedule x Bit-Width Boundary in Sub-100M Quantisation-Aware Training},
author = {Christian Brandt Thomassen},
journal= {arXiv preprint arXiv:2605.25966},
year = {2026}
}
备注
20 pages, 6 figures, 4 tables. 1345 training runs total (720 + 625). Submitted for review at TMLR