重新审视大规模语言模型训练中下游指标的缩放特性
机器学习
2025-12-10 v1 人工智能
计算与语言
摘要
虽然大规模语言模型(LLM)的缩放定律传统上关注预训练损失等代理指标,但预测下游任务性能一直被认为是不可靠的。本文通过提出一个直接从训练预算建模基准性能缩放行为的框架,挑战了这一观点。我们发现,对于固定的 token-to-parameter 比率,一个简单的幂律可以准确描述多个流行下游任务上对数准确率的缩放行为。我们的结果表明,直接方法比此前提出的两阶段 procedure 外推效果更好,后者容易产生误差累积。此外,我们引入了能够预测不同 token-to-parameter 比率下准确率并考虑重复采样下推理计算的功能形式。我们在最多 17B 参数、最多 350B tokens 的模型上验证了我们的发现,涵盖两种数据集混合。为支持可复现性并鼓励未来研究,我们发布了完整的预训练损失和下游评估结果。
引用
@article{arxiv.2512.08894,
title = {Revisiting the Scaling Properties of Downstream Metrics in Large Language Model Training},
author = {Jakub Krajewski and Amitis Shidani and Dan Busbridge and Sam Wiseman and Jason Ramapuram},
journal= {arXiv preprint arXiv:2512.08894},
year = {2025}
}