中文

Horizon-LM:面向 LLM 训练的内存中心体系结构

计算机科学与博弈论 2026-02-05 v1 离散数学 理论经济学 组合数学

摘要

大型语言模型 (LLM) 的快速增长已超过单 GPU 硬件的演进,使得模型规模 increasingly 受限于内存容量而非计算资源。虽然现代训练系统通过分布式并行和在 CPU 与存储层之间的卸载来扩展 GPU 内存,但它们根本保留了 GPU 中心的执行范式,使得 GPU 托管持久化模型副本和完整的 autograd 图。因此,规模化的大型模型仍严格依赖于多 GPU 集群、复杂的分布式运行时以及不可预测的主机内存消耗,这为节点规模的后训练工作负载(如指令调优、对齐和领域适应)创造了重大障碍。我们提出 Horizon-LM,这是一种以内存为中心的训练系统,重新定义了 CPU 和 GPU 在大规模模型优化中的角色。Horizon-LM 将主机内存视为权威的参数存储库,并将 GPU 仅用作瞬时计算引擎,采用 CPU 主导、GPU 模板的执行模型。通过消除持久的 GPU 驻留模块和 autograd 图、采用显式重计算并手动进行梯度传播,以及引入流水线双缓冲执行引擎,Horizon-LM 脱钩了模型规模与 GPU 数量的关系,并将内存使用限制在理论参数占用空间之内。在配备 1.5TB 主机内存的单台 H200 GPU 上,Horizon-LM 能够可靠地训练最高 1200 亿参数的模型。在标准单 A100 机器上,Horizon-LM 相较于 DeepSpeed ZeRO-3 的 CPU 卸载方案,在训练吞吐量上实现最高 12.2 倍的提升,同时保持数值正确性。跨平台和跨规模,Horizon-LM 维持了高设备利用率和可预测的内存增长,表明主机内存而非 GPU 内存才是节点规模大型模型训练的真正可行边界。

关键词

引用

@article{arxiv.2602.04815,
  title  = {Winning in the Limit: Average-Case Committee Selection with Many Candidates},
  author = {Yifan Lin and Shenyu Qin and Kangning Wang and Lirong Xia},
  journal= {arXiv preprint arXiv:2602.04815},
  year   = {2026}
}