用于语言模型扩展的热启动
机器学习
2024-11-13 v1 人工智能
摘要
通过扩大模型规模来提升性能,在当前大语言模型范式中效果显著。各类缩放研究的理论与实证发现产生了新的缩放结果与定律,指导后续研究。当代数据与模型规模的高昂训练成本,导致对如何调优并达到此类训练设置缺乏深入理解。降低大模型预训练成本的一个方向是,从更便宜调优的小模型热启动大规模训练。本文旨在理解在用于扩展的热启动下,最优超参数的行为能否保持。我们探索了简单操作,使得基于理论的零样本最优超参数迁移方法(μTransfer)得以应用。我们研究了在 μTransfer 热启动下,促成收敛加速与稳定训练动态保持的因素。我们发现,收缩小模型权重、零填充,并用来自 μP 的缩放初始化扰动所得大模型,能实现有效的热启动。
引用
@article{arxiv.2411.07340,
title = {Warmstarting for Scaling Language Models},
author = {Neeratyoy Mallik and Maciej Janowski and Johannes Hog and Herilalaina Rakotoarison and Aaron Klein and Josif Grabocka and Frank Hutter},
journal= {arXiv preprint arXiv:2411.07340},
year = {2024}
}