中文

训练开销比:大语言模型训练系统的实用可靠性指标

分布式、并行与集群计算 2024-10-10 v3 人工智能

摘要

大语言模型(LLMs)以其卓越能力正在革新人工智能行业。训练这些模型需要大规模GPU集群和大量计算时间,导致频繁失败,显著增加训练成本。尽管其重要性,该领域缺乏评估可靠性的指标。在本工作中,我们引入了一种新的可靠性指标——训练开销比(TOR),用于评估容错LLM训练系统的可靠性。TOR定义为最优训练时间与系统观测训练时间之比,作为用户估算在给定系统上训练LLM实际所需时间的实用工具。此外,我们的研究识别了提升可靠性的关键因素,并针对实践中遇到的各类故障给出了TOR方程。

关键词

引用

@article{arxiv.2408.07482,
  title  = {Training Overhead Ratio: A Practical Reliability Metric for Large Language Model Training Systems},
  author = {Ning Lu and Qian Xie and Hao Zhang and Wenyi Fang and Yang Zheng and Zheng Hu and Jiantao Ma},
  journal= {arXiv preprint arXiv:2408.07482},
  year   = {2024}
}

备注

To be published in: IEEE International Symposium on Software Reliability Engineering (ISSRE2024) workshop