后训练量化大型语言模型的比例规律
机器学习
2024-12-09 v3 计算与语言
摘要
众所周知,经过充分训练的大型语言模型 (LLM) 的泛化能力会随模型规模而可预测地扩展。与 pre-training 具有实际比例规律的 LLM 质量不同,后训练压缩后 LLM 的质量高度不可预测,通常需要案例逐个验证。本文通过对多组 LLM 进行系统实证研究,对其进行大量低精度张量数据类型的量化,并采用流行的权重量化技术,我们识别了与局部损失景观特征相关的关键比例因子,据此可对量化后 LLM 的性能进行较好的预测。
引用
@article{arxiv.2410.12119,
title = {Scaling Laws for Post Training Quantized Large Language Models},
author = {Zifei Xu and Alexander Lan and Wanzin Yazar and Tristan Webb and Sayeh Sharify and Xin Wang},
journal= {arXiv preprint arXiv:2410.12119},
year = {2024}
}