通过后训练模型扩展改进量化技术
机器学习
2025-08-29 v2 人工智能
硬件体系结构
摘要
模型规模一直是其质量以及成本的强预测因子。因此,在模型成本与质量之间的权衡已受到良好研究。后训练优化,如量化和剪枝,通常侧重于减少预训练模型的总体规模,以降低推理成本并维持模型质量。然而,近期进展引入了一些优化技术,有趣的是扩展后训练的模型,增加模型规模以在减小规模时提升质量。例如,为实现 4 位权重和激活量化,无协性处理通常需要在计算图中插入在线哈达巴赫旋转,并且保留高度敏感权重常常需要额外的高精度计算。然而,如果应用需求无法满足,普遍做法是放宽量化约束。相反,我们展示后训练模型扩展是一种可行策略,能够在量化协同设计空间内提升模型质量,并提供理论依据。我们证明可以在不进行端到端重新训练的情况下,逐步有选择地扩展预训练大型语言模型(LLM)的规模,以提升模型质量。特别是当对 Llama3 1B 的权重和激活量化到 4 位时,我们将与 QuaRot 和 SpinQuant 相比,使全精度困惑值差距平均减少 9%,仅增加 5% 的参数,仍比 BF16 参考模型减少 3.8% 的体积。
引用
@article{arxiv.2503.17513,
title = {Improving Quantization with Post-Training Model Expansion},
author = {Giuseppe Franco and Pablo Monteagudo-Lago and Ian Colbert and Nicholas Fraser and Michaela Blott},
journal= {arXiv preprint arXiv:2503.17513},
year = {2025}
}