中文

无限算力下的预训练

机器学习 2025-09-19 v1

摘要

由于算力增长远快于语言模型预训练可用的网络文本,我们研究在固定数据和无算力约束下应如何进行预训练。我们首先表明,现有受数据约束的方法——增加epoch数和参数数量——最终会过拟合,并通过适当调整正则化显著改进这些方案,发现最优权重衰减是标准实践的30倍。由于我们的正则化方案随参数数量单调递减损失并遵循简单的幂律缩放,我们通过缩放定律的渐近线而非固定算力预算下的性能来估计其最佳性能。然后我们发现,独立训练模型的集成比正则化方案实现了显著更低的损失渐近线。我们最佳的干预方案结合了epoching、正则化、参数缩放和集成缩放,在200M token上实现了渐近线,使用比基线少5.17倍的数据,且我们的数据缩放定律预测这种改进在更高的token预算下仍然持续。我们发现,数据效率的提升可以在更小的参数数量下实现,因为我们可以将集成蒸馏为一个小8倍且保留83%集成收益的学生模型。最后,我们为验证损失设计的干预措施推广到下游基准,在预训练评估上实现了9%的提升,在数学中间训练数据上的持续预训练上实现了17.5倍的数据效率提升。我们的结果表明,简单的算法改进可以在算力充裕的未来实现显著更高效的预训练。

关键词

引用

@article{arxiv.2509.14786,
  title  = {Pre-training under infinite compute},
  author = {Konwoo Kim and Suhas Kotha and Percy Liang and Tatsunori Hashimoto},
  journal= {arXiv preprint arXiv:2509.14786},
  year   = {2025}
}