中文

理解LLM微调的性能并估算其成本

计算与语言 2024-08-15 v1 人工智能 机器学习

摘要

由于训练大语言模型(LLMs)的成本高昂,微调已成为一种有吸引力的替代方案,可利用有限的计算资源以经济高效的方式将LLMs专门化于特定任务。在本文中,我们刻画了基于稀疏混合专家(MoE)的大语言模型微调,以理解其在单个GPU上的准确性和运行时性能。我们的评估提供了对稀疏和密集版本MoE模型训练效能及其运行时特征的独特见解,包括最大批次大小、执行时间分解、端到端吞吐量、GPU硬件利用率和负载分布。我们的研究识别出MoE层的优化对于进一步提升LLM微调性能至关重要。利用我们的分析结果,我们还开发并验证了一个用于估算云端LLM微调成本的解析模型。该模型基于模型参数和GPU架构,估计LLM吞吐量和训练成本,帮助工业界和学术界从业者预算微调特定模型的成本。

关键词

引用

@article{arxiv.2408.04693,
  title  = {Understanding the Performance and Estimating the Cost of LLM Fine-Tuning},
  author = {Yuchen Xia and Jiho Kim and Yuhan Chen and Haojie Ye and Souvik Kundu and Cong Hao and Nishil Talati},
  journal= {arXiv preprint arXiv:2408.04693},
  year   = {2024}
}

备注

10 pages, conference