可预测的规模:第二部分,Farseer:大型语言模型中的一项精炼缩放律
机器学习
2025-07-17 v3 人工智能
摘要
训练大型语言模型(LLMs)的成本极其高昂,这造成了关键的缩放鸿沟,使得小规模实验的洞察往往无法迁移到资源密集的生产系统中,从而阻碍了高效创新。为弥合这一鸿沟,我们引入了Farseer,一种新颖且精炼的缩放律,在各规模下提供了更高的预测准确性。通过系统构建模型损失面,Farseer实现了对经验数据比先前缩放律(如Chinchilla缩放律)显著更好的拟合。我们的方法产生了准确、稳健且高度可泛化的预测,展现出优异的外推能力,与Chinchilla缩放律相比将外推误差降低了433%。这使得能够对所有设置下的竞争训练策略进行可靠评估,从而可以将小规模消融研究的结论自信地外推以预测大规模性能。此外,Farseer为最优算力分配提供了新见解,更好地反映了现代LLM训练的细微需求。为验证我们的方法,我们在不同规模和配置下训练了约1,000个LLM的广泛套件,消耗了约300万个NVIDIA H100 GPU小时。我们在 https://github.com/Farseer-Scaling-Law/Farseer 上全面开源所有模型、数据、结果和日志,以促进进一步研究。
引用
@article{arxiv.2506.10972,
title = {Predictable Scale: Part II, Farseer: A Refined Scaling Law in Large Language Models},
author = {Houyi Li and Wenzhen Zheng and Qiufeng Wang and Zhenyu Ding and Haoying Wang and Zili Wang and Shijie Xuyang and Ning Ding and Shuigeng Zhou and Xiangyu Zhang and Daxin Jiang},
journal= {arXiv preprint arXiv:2506.10972},
year = {2025}
}
备注
34