中文

语言模型的算法进步

计算与语言 2024-03-12 v1 人工智能

摘要

我们研究了自深度学习出现以来,语言模型预训练算法的改进速度。使用一个包含2012年至2023年间在Wikitext和Penn Treebank上进行的200多次语言模型评估的数据集,我们发现达到特定性能阈值所需的算力大约每8个月减半,95%置信区间约为5至14个月,这显著快于摩尔定律带来的硬件性能提升。我们估计了增强缩放定律,这使我们能够量化算法进步,并确定缩放模型与训练算法创新的相对贡献。尽管算法进步迅速且发展了诸如Transformer等新架构,但我们的分析表明,在这一时期,算力的增加对整体性能提升做出了更大的贡献。尽管受到有噪声的基准测试数据的限制,我们的分析仍量化了语言建模的快速进步,揭示了算力与算法的相对贡献。

关键词

引用

@article{arxiv.2403.05812,
  title  = {Algorithmic progress in language models},
  author = {Anson Ho and Tamay Besiroglu and Ege Erdil and David Owen and Robi Rahman and Zifan Carl Guo and David Atkinson and Neil Thompson and Jaime Sevilla},
  journal= {arXiv preprint arXiv:2403.05812},
  year   = {2024}
}