中文

规模定律估计指南

机器学习 2025-06-04 v2 人工智能 计算与语言

摘要

规模定律预测目标机器学习模型的损失,通过外推更容易训练的模型(例如参数更少或训练集更小的模型)来实现。这为从业者和研究人员提供了一种高效的方法,用于比较涉及优化器、数据集和模型架构的预训练决策。尽管规模定律广泛用于建模语言模型训练的动态,但关于如何正确估计和解释它们的工作仍寡言少语。我们收集(并公开)一个大型数据集,包含 485 个之前发表的预训练模型的损失和下游评估结果。我们使用这些数据估计超过 1000 条规模定律,然后推导出一套关于在新模型族中估计规模定律的最佳实践。我们发现,将规模定律拟合到训练运行的中间检查点(而不仅仅是其最终损失)可显著提高准确度,并且——在其他条件相同的情况下——来自相似模型大小的估计通常最为准确。然而,由于模型随机种子之间存在显著的变异性,有时训练多个小模型比训练一个大模型更有用。此外,尽管不同模型族的规模行为存在差异,但它们往往足够相似,以至于可以从单个具有相同模型架构的模型,以及来自其他模型族的规模参数估计来预测目标模型的行为。

关键词

引用

@article{arxiv.2410.11840,
  title  = {A Hitchhiker's Guide to Scaling Law Estimation},
  author = {Leshem Choshen and Yang Zhang and Jacob Andreas},
  journal= {arXiv preprint arXiv:2410.11840},
  year   = {2025}
}

备注

ICML