中文

减少大型模型训练中的能量膨胀

机器学习 2024-09-24 v3 分布式、并行与集群计算

摘要

在大量GPU上训练大型AI模型消耗巨大能量,使得电力输送成为构建和运营AI工作负载数据中心的最大限制因素之一。然而,我们观察到训练过程中消耗的能量并非全部直接贡献于端到端吞吐量;其中相当一部分可以在不减缓训练速度的情况下被移除。我们将这部分称为能量膨胀。在这项工作中,我们识别了大型模型训练中能量膨胀的两个独立来源,并提出了Perseus,一个能够缓解这两种膨胀的训练系统。为此,Perseus使用一种基于图割的高效算法获取大型模型训练任务的时间-能量权衡前沿,并跨时间调度计算能耗以减少两种类型的能量膨胀。在包括GPT-3和Bloom在内的大型模型上的评估表明,Perseus在不损失任何吞吐量或修改硬件的情况下,将大型模型训练的能量消耗降低了高达30%。

关键词

引用

@article{arxiv.2312.06902,
  title  = {Reducing Energy Bloat in Large Model Training},
  author = {Jae-Won Chung and Yile Gu and Insu Jang and Luoxi Meng and Nikhil Bansal and Mosharaf Chowdhury},
  journal= {arXiv preprint arXiv:2312.06902},
  year   = {2024}
}

备注

SOSP 24 | Open-source part of Zeus at https://ml.energy/zeus/research_overview/perseus/