中文

SuperOffload:釆取大规模LLM训练于Superchip的力量

机器学习 2025-09-26 v1 分布式、并行与集群计算

摘要

超级芯片(Superchips)的出现代表了下一代AI硬件的重大进步。这些Superchip采用紧密耦合的异构架构,将GPU和CPU集成在同一封装内,提供了前所未有的计算能力。然而,针对这种新架构的LLM训练尚无大量研究。在本工作中,我们首次研究基于卸载的Superchip LLM训练解决方案。我们观察到Superchip与传统松耦合GPU-CPU架构之间的重要差异,这迫使我们重新审视关于卸载的先行假设。基于此,我们提出SuperOffload,一个面向Superchip的卸载系统,更高效地同时使用Hopper GPU、Grace CPU和NVLink-C2C互连。SuperOffload通过一系列技术实现,包括自适应权重卸载、bucketization repartitioning、Superchip-aware casting、speculative execution以及针对Grace CPU高度优化的Adam优化器。我们在NVIDIA GH200上评估SuperOffload,显示相较于最先进的基于卸载的系统,吞吐量提升最高可达2.5倍,使在单颗Superchip上训练最高可达25B模型,同时实现高训练吞吐。我们还将SuperOffload与ZeRO风格的数据并行和DeepSpeed-Ulysses序列并行相集成,使在8个GH200上训练13B模型,序列长度可达100万 token,实现55% MFU。

关键词

引用

@article{arxiv.2509.21271,
  title  = {SuperOffload: Unleashing the Power of Large-Scale LLM Training on Superchips},
  author = {Xinyu Lian and Masahiro Tanaka and Olatunji Ruwase and Minjia Zhang},
  journal= {arXiv preprint arXiv:2509.21271},
  year   = {2025}
}

备注

16 pages, 15 figures