剖析大语言模型训练、微调与推理的运行性能
性能
2023-12-04 v2 计算与语言
机器学习
摘要
大语言模型(LLMs)在学术界与工业界均取得了巨大进展,其流行催生了众多用于加速LLM预训练、微调和推理的开源框架与技术。训练和部署LLM代价高昂,因其需要大量计算资源与内存,因此已开发许多高效方法以改进系统流水线及算子。然而,运行性能在硬件与软件栈之间差异显著,这使得最佳配置的选择十分困难。本工作中,我们旨在从宏观与微观两个角度对性能进行基准测试。首先,我们在三个8-GPU平台上,针对7、13和70亿参数(7B、13B和70B)不同规模的LLM,在采用与不采用个别优化技术(包括ZeRO、量化、重计算、FlashAttention)的情况下,对其预训练、微调和服务的端到端性能进行基准测试。随后,我们深入对子模块(包括LLM中的计算与通信算子)进行详细的运行时分析。对于终端用户,我们的基准测试与发现有助于更好地理解不同优化技术、训练与推理框架以及硬件平台,从而在选择LLM部署配置时提供参考。对于研究人员,我们深入的模块级分析揭示了未来工作中进一步优化LLM运行性能的潜在机会。
引用
@article{arxiv.2311.03687,
title = {Dissecting the Runtime Performance of the Training, Fine-tuning, and Inference of Large Language Models},
author = {Longteng Zhang and Xiang Liu and Zeyu Li and Xinglin Pan and Peijie Dong and Ruibo Fan and Rui Guo and Xin Wang and Qiong Luo and Shaohuai Shi and Xiaowen Chu},
journal= {arXiv preprint arXiv:2311.03687},
year = {2023}
}