训练计算最优的大语言模型
计算与语言
2023-01-08 v1 机器学习
摘要
我们研究了在给定计算预算下训练transformer语言模型的最优模型规模与token数量。我们发现当前大语言模型(LLM)显著训练不足,这是近期在保持训练数据量不变的同时专注于扩展语言模型规模所致。通过在5亿至5000亿token上训练超过400个从7000万到超过160亿参数的语言模型,我们发现对于计算最优训练,模型规模与训练token数量应等比例扩展:模型规模每翻倍,训练token数量也应翻倍。我们通过训练一个预测的计算最优模型Chinchilla来检验该假设,其使用与Gopher相同的计算预算但具有70B参数和4更多的数据。Chinchilla在大量下游评估任务上一致且显著优于Gopher(280B)、GPT-3(175B)、Jurassic-1(178B)和Megatron-Turing NLG(530B)。这也意味着Chinchilla在微调与推理上使用显著更少的计算,极大便利了下游使用。作为亮点,Chinchilla在MMLU基准上达到了67.5%的SOTA平均准确率,比Gopher高出逾7%。
引用
@article{arxiv.2203.15556,
title = {Training Compute-Optimal Large Language Models},
author = {Jordan Hoffmann and Sebastian Borgeaud and Arthur Mensch and Elena Buchatskaya and Trevor Cai and Eliza Rutherford and Diego de Las Casas and Lisa Anne Hendricks and Johannes Welbl and Aidan Clark and Tom Hennigan and Eric Noland and Katie Millican and George van den Driessche and Bogdan Damoc and Aurelia Guy and Simon Osindero and Karen Simonyan and Erich Elsen and Jack W. Rae and Oriol Vinyals and Laurent Sifre},
journal= {arXiv preprint arXiv:2203.15556},
year = {2023}
}