低位量化偏好欠训练的大语言模型:100T 训练标记的量化比例定律
机器学习
2024-11-28 v2 计算与语言
摘要
我们揭示了低位量化偏好欠训练的大语言模型(LLMs),通过观察到具有更大规模或更少训练标记的模型在应用低位量化时经历的量化引起的退化(QiD)更少,而规模较小且训练标记丰富的模型则遭受显著的 QiD。为深入了解这一趋势,我们在受控环境下研究了超过 1500 个不同规模和不同训练水平(欠训练或完全训练)的量化 LLM 检查点,推导出用于理解 QiD 与训练标记数量、模型规模和位宽之间关系的比例定律。通过推导的比例定律,我们提出了一种新观点:我们可以利用 QiD 来衡量 LLM 的训练水平,并确定各种规模 LLM 所需的完全训练标记数量。此外,我们利用比例定律预测了不同规模 LLM 在 100 万亿标记训练下的量化性能。我们的预测表明,预计将训练超过 100 万亿标记的未来模型,其低位量化性能可能并非理想。这为未来低位量化提出了潜在挑战,并强调在评估低位量化研究时需关注模型的训练水平。为促进此问题的未来研究,我们在 https://huggingface.co/Xu-Ouyang 发布了本工作中使用的全部 1500 多个以上量化检查点。
引用
@article{arxiv.2411.17691,
title = {Low-Bit Quantization Favors Undertrained LLMs: Scaling Laws for Quantized LLMs with 100T Training Tokens},
author = {Xu Ouyang and Tao Ge and Thomas Hartvigsen and Zhisong Zhang and Haitao Mi and Dong Yu},
journal= {arXiv preprint arXiv:2411.17691},
year = {2024}
}
备注
Work in Progress