少数GPU,大规模扩展:使用 PrismLLM 实现高保真大语言模型训练仿真
分布式、并行与集群计算
2026-05-18 v1 人工智能
摘要
如今,大语言模型(LLM)的训练运行在跨越数千个 GPU 的集群上。虽然这种规模能够实现快速的模型进步,但开发、调试和性能调优训练框架不可避免地变得复杂且成本高昂。这是因为工程师通常需要重现生产行为来诊断故障或评估优化,从而需要频繁甚至独占性地访问生产规模的集群——鉴于大多数 GPU 已投入生产工作负载,这变得越来越困难。仿真依赖于难以维护的复杂性能模型,而缩小的实验通常无法捕捉到与规模相关的行为。我们提出 PrismLLM,将大规模执行与访问大型集群的需求解耦,使工程师能够仅使用少数 GPU 就能在高保真的大规模行为下运行和观察感兴趣的进程。PrismLLM 通过一种基于切片的方法构建高保真执行图,该方法捕获目标规模的计算、通信和依赖关系。然后,PrismLLM 执行混合仿真,其中选定的进程运行原始程序,而其余进程则作为虚拟参与者进行重放。在大规模 LLM 训练工作负载上的实验表明,PrismLLM 能够准确地重现性能和内存行为,迭代时间的平均误差仅为 0.58%,峰值 GPU 内存使用量的误差小于 0.01%。PrismLLM 可以使用少于原始部署所需物理 GPU 的 1% 来仿真多达 8192 个 GPU 的集群。
引用
@article{arxiv.2605.15617,
title = {A Few GPUs, A Whole Lotta Scale: Faithful LLM Training Emulation with PrismLLM},
author = {Shaoke Xi and ChonLam Lao and Boyi Jia and Jiaqi Gao and Zhipeng Zhang and Jiamin Cao and Brian Sutioso and Erci Xu and Minlan Yu and Kui Ren and Yong Li and Zhengping Qian and Ennan Zhai and Jingren Zhou},
journal= {arXiv preprint arXiv:2605.15617},
year = {2026}
}
备注
13 pages body, 21 pages total