小规模大型语言模型训练的计算瓶颈
机器学习
2024-12-03 v2
摘要
虽然大型语言模型(LLM)主导着人工智能领域,但小规模大型语言模型(SLM)因消费者对成本和效率的需求而日益受到关注。然而,关于SLM训练行为和计算需求的研究仍有限。本研究通过考察各种超参数和配置的影响,包括GPU类型、批量大小、模型规模、通信协议、注意力类型和GPU数量,探索了训练SLM(最高达20亗参数)的计算瓶颈。我们使用诸如每美元损失和每秒标记数等指标对这些因素进行评估。我们的发现旨在支持更广泛的语言模型训练,以服务于低资源AI研究机构。
引用
@article{arxiv.2410.19456,
title = {Computational Bottlenecks of Training Small-scale Large Language Models},
author = {Saleh Ashkboos and Iman Mirzadeh and Keivan Alizadeh and Mohammad Hossein Sekhavat and Moin Nabi and Mehrdad Farajtabar and Fartash Faghri},
journal= {arXiv preprint arXiv:2410.19456},
year = {2024}
}
备注
8 pages, 4 figures