训练动力学对后训练量化鲁棒性的影响
机器学习
2026-02-02 v2
摘要
后训练量化广泛用于大型语言模型的高效部署,但量化鲁棒性的 underlying 机制仍不清晰。我们对量化性能进行了全面分析,研究了最高达320亿参数、15万亿训练标记的开源语言模型训练轨迹,以准确评估训练动力学与量化性能之间的关系。我们的关键发现是,大规模训练运行中的量化误差由学习率与其他训练超参数之间的复杂相互作用驱动。具体而言,一旦学习率衰减,验证损失和量化误差便会发生分离,与训练数据规模基本独立。为调查训练动力学上的干预措施并识别能够有利地调制量化鲁棒性的特定配置,我们在受控实验中训练了自己的模型,最多达1000亿训练标记。我们的结果挑战了“增加数据集规模本质上会妨碍量化效果”的假设,证明相反,战略性的训练超参数干预可以在规模扩大的同时提高量化质量。
引用
@article{arxiv.2510.06213,
title = {Training Dynamics Impact Post-Training Quantization Robustness},
author = {Albert Catalan-Tatjer and Niccolò Ajroldi and Jonas Geiping},
journal= {arXiv preprint arXiv:2510.06213},
year = {2026}
}