中文

nanoLM:通过跨尺度精确损失预测实现的低成本 LLM 预训练基准

计算与语言 2024-04-09 v4 机器学习

摘要

随着语言模型规模扩大,验证研究想法的成本日益高昂,因为小模型上的结论并不能轻易迁移至大模型。一种可能的解决方案是建立一个通用系统,无需训练即可准确预测大模型的某些指标。现有缩放定律需要在最大模型上进行超参数搜索,限制了其预测能力。本文提出一种预测预训练损失的方法(即 {\mu}Scaling),基于我们的观察:最大更新参数化({\mu}P)能够在超参数空间中接近常见损失盆地处精确拟合缩放定律。借助 {\mu}Scaling,不同模型设计可通过仅训练其较小对应模型而在大规模上进行比较。此外,我们引入 nanoLM:一个促进这一新研究范式的低成本 LLM 预训练基准。以约 14% 的一次性预训练成本,我们即可准确预测高达 52B 模型的损失。我们以 nanoLM 的目标是赋能资源有限的研究人员在大型模型上得出有意义的结论。我们也期望我们的基准能成为学术界与工业界之间的桥梁。{\mu}Scaling 的代码见 https://github.com/cofe-ai/Mu-scaling。nanoLLM 的代码稍后发布。

关键词

引用

@article{arxiv.2304.06875,
  title  = {nanoLM: an Affordable LLM Pre-training Benchmark via Accurate Loss Prediction across Scales},
  author = {Yiqun Yao and Siqi fan and Xiusheng Huang and Xuezhi Fang and Xiang Li and Ziyi Ni and Xin Jiang and Xuying Meng and Peng Han and Shuo Shang and Kang Liu and Aixin Sun and Yequan Wang},
  journal= {arXiv preprint arXiv:2304.06875},
  year   = {2024}
}

备注

This is a modified and extended version of our previous Mu-scaling work released in April 2023 (see v1)