中文

小规模大型语言模型训练的计算瓶颈

机器学习 2024-12-03 v2

摘要

虽然大型语言模型(LLM)主导着人工智能领域,但小规模大型语言模型(SLM)因消费者对成本和效率的需求而日益受到关注。然而,关于SLM训练行为和计算需求的研究仍有限。本研究通过考察各种超参数和配置的影响,包括GPU类型、批量大小、模型规模、通信协议、注意力类型和GPU数量,探索了训练SLM(最高达20亗参数)的计算瓶颈。我们使用诸如每美元损失和每秒标记数等指标对这些因素进行评估。我们的发现旨在支持更广泛的语言模型训练,以服务于低资源AI研究机构。

关键词

引用

@article{arxiv.2410.19456,
  title  = {Computational Bottlenecks of Training Small-scale Large Language Models},
  author = {Saleh Ashkboos and Iman Mirzadeh and Keivan Alizadeh and Mohammad Hossein Sekhavat and Moin Nabi and Mehrdad Farajtabar and Fartash Faghri},
  journal= {arXiv preprint arXiv:2410.19456},
  year   = {2024}
}

备注

8 pages, 4 figures