生成式语言模型的预训练比例规律
机器学习
2026-02-03 v2
摘要
神经比例规律推动了该领域参数、数据和计算资源不断指数级增长。虽然预训练损失和判别性基准的比例行为已广为人知,但生成式基准(如数学问题解决或软件工程)仍鲜有探索。我们提出并评估了三种不同的预训练比例规律,用于拟合生成式评估中的 pass-at- 以及预测最昂贵模型的 pass-at-。我们三种比例规律的差异在于所使用的协变量:(1) 预训练计算、(2) 模型参数和预训练标记、(3) 黄金参考解的对数似然。首先,我们表明生成式评估引入了新的超参数(在我们的情况下为 ),其作为比例行为的控制杆,调制了比例规律参数以及性能的可预测性。其次,我们识别出参数稳定性的显著差异:虽然计算和参数+标记规律仅在约 - 个数量级内稳定,但黄金参考似然规律唯一稳定,跨约 个数量级均收敛。最后,就预测性能而言,我们发现所有三种比例规律的表现相当不错,尽管计算规律在小 时预测稍差,黄金参考似然规律在大 时预测稍差。最后,我们建立了理论联系,证明计算比例规律是参数与标记规律的计算最优包络。我们的框架为研究人员和实践者提供了洞见和方法,以预测生成式性能,加速推进能够推理、解决和创造的模型。
引用
@article{arxiv.2509.24012,
title = {Pretraining Scaling Laws for Generative Evaluations of Language Models},
author = {Rylan Schaeffer and Noam Levi and Brando Miranda and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2509.24012},
year = {2026}
}