中文

利用稀疏性与数据流高效训练大语言模型

机器学习 2023-04-13 v1

摘要

大型基础语言模型已展现出其通用性,能够适配执行广泛的下游任务,如文本生成、情感分析、语义搜索等。然而,训练此类大型基础模型并非易事,需要大量算力以及来自机器学习与系统专家的专业知识。随着模型增大,这些需求只增不减。稀疏性是一种有前景的缓解训练算力需求的技术。然而,稀疏性在为训练稀疏模型达到与稠密模型同等质量方面引入了新的挑战。此外,稀疏性降低了操作强度并引入不规则内存访问模式,使得高效利用计算资源变得困难。本文展示了在大型语言模型——130 亿参数 GPT——上使用稀疏性与数据流进行端到端训练的流程。数据流执行模型与架构实现了高效的片上不规则内存访问,以及原生的核融合与流水线并行,有助于恢复设备利用率。我们表明,我们可以成功训练出与稠密 GPT 13B 模型质量相同的 GPT 13B,同时相较稠密 A100 基线实现端到端 4.5 倍加速。

关键词

引用

@article{arxiv.2304.05511,
  title  = {Training Large Language Models Efficiently with Sparsity and Dataflow},
  author = {Venkat Srinivasan and Darshan Gandhi and Urmish Thakker and Raghu Prabhakar},
  journal= {arXiv preprint arXiv:2304.05511},
  year   = {2023}
}