中文

Cerebras-GPT:在 Cerebras 晶圆级集群上训练的开源计算最优语言模型

机器学习 2023-04-07 v1 计算与语言

摘要

我们研究近期通过高效预训练与缩放、开放数据集与工具来改进大语言模型的研究进展。我们结合这些进展引入 Cerebras-GPT,一个从 111M 到 13B 参数规模的开源计算最优语言模型族。我们遵循 DeepMind Chinchilla 缩放规则,在 Eleuther Pile 数据集上训练 Cerebras-GPT 模型以实现高效预训练(在给定计算预算下的最高精度)。我们刻画了可预测的幂律缩放,并将 Cerebras-GPT 与其他公开可用模型比较,表明所有 Cerebras-GPT 模型在预训练与下游目标上均具最先进(state-of-the-art)训练效率。我们描述了所得经验,包括最大更新参数化(μ\muP)如何进一步改进大模型缩放,在规模上提升精度与超参数可预测性。我们发布预训练模型与代码,使本文成为首个开放且可复现的、将计算最优模型缩放与在固定数据集大小上训练的模型进行比较的工作。Cerebras-GPT 模型可在 HuggingFace 获取:https://huggingface.co/cerebras。

关键词

引用

@article{arxiv.2304.03208,
  title  = {Cerebras-GPT: Open Compute-Optimal Language Models Trained on the Cerebras Wafer-Scale Cluster},
  author = {Nolan Dey and Gurpreet Gosal and Zhiming and Chen and Hemant Khachane and William Marshall and Ribhu Pathria and Marvin Tom and Joel Hestness},
  journal= {arXiv preprint arXiv:2304.03208},
  year   = {2023}
}

备注

13 pages main text, 16 pages appendix, 13 figures