精度的比例定律
机器学习
2024-12-03 v2 计算与语言
摘要
低精度训练和推理既影响语言模型的质量,也影响其成本,但当前的比例定律未能考虑这一因素。在本工作中,我们提出了针对训练和推理的“精度感知”比例定律。我们提出,在较低精度下训练会减少模型的“有效参数数量”,从而预测因在低精度下训练以及后训练量化所导致的额外损失。对于推理,我们发现后训练量化引入的性能下降随着模型训练数据的增加而增长,最终导致额外的预训练数据实际上具有有害作用。对于训练,我们的比例定律允许预测不同部件以不同精度训练的模型的损失,并建议在较低精度下训练更大的模型可能更具计算效率。我们将后训练和预训练量化的比例定律统一为一种单一函数形式,用于预测在各种精度下训练和推理所导致的性能下降。我们在超过465次预训练运行上进行拟合,并在参数规模达到17亿、训练数据达到260亿token的模型上验证了这些预测。
引用
@article{arxiv.2411.04330,
title = {Scaling Laws for Precision},
author = {Tanishq Kumar and Zachary Ankner and Benjamin F. Spector and Blake Bordelon and Niklas Muennighoff and Mansheej Paul and Cengiz Pehlevan and Christopher Ré and Aditi Raghunathan},
journal= {arXiv preprint arXiv:2411.04330},
year = {2024}
}