超越Chinchilla最优:在语言模型缩放定律中考虑推理成本
机器学习
2025-04-15 v3 计算与语言
摘要
大语言模型缩放定律是经验公式,用于估计模型质量随参数数量和训练数据增加的变化。然而,这些公式(包括流行的Deepmind Chinchilla缩放定律)忽略了推理成本。我们修改了Chinchilla缩放定律,以计算给定质量和推理需求下训练和部署模型的最优大语言模型参数数量和预训练数据大小。我们既从计算预算角度也从实际成本角度进行分析,发现预期推理需求相当大(约10亿次请求)的大语言模型研究者应该训练比Chinchilla最优更小、更长的模型。此外,我们训练了47个不同大小和参数数量的模型来验证我们的公式,发现当我们将每个参数的标记数扩展到极端范围(高达10,000)时,模型质量持续改善。最后,我们消融了用于拟合Chinchilla缩放定律系数的过程,发现仅从典型标记/参数比率下收集的数据开发缩放定律会高估额外标记在这些极端范围的影响。
引用
@article{arxiv.2401.00448,
title = {Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws},
author = {Nikhil Sardana and Jacob Portes and Sasha Doubov and Jonathan Frankle},
journal= {arXiv preprint arXiv:2401.00448},
year = {2025}
}
备注
16 pages, 7 figures, In the 41st International Conference on Machine Learning, 2024