中文

超越预训练:HPC系统中基础模型的完整生命周期

分布式、并行与集群计算 2026-04-15 v1

摘要

大规模预训练基础模型(FM)是支持AI在多样化科学和社会应用领域的计算密集型第一阶段。该第一阶段已使高性能计算(HPC)设施成为“主权AI”倡议不可或缺的 backbone。虽然FM预训练的巨大吞吐量需求与HPC传统以能力为导向的使命相吻合,但后续的AI生命周期阶段,通常称为微调和推理,引入的操作范式可能与 established batch-processing环境产生冲突。此外,这些阶段也并非计算上微不足道:它们往往需要大量高端计算资源,同时 exhibits与预训练相比的硬件利用模式显著不同。本文解决将完整AI生命周期在国家超级计算设施中实现的架构和战略挑战。我们 presented正在开发并部署于瑞士国家超级计算中心(CSCS)的一种混合云原生平台,将无磁盘GPU-enabled HPE Cray EX计算节点与虚拟化商品基础设施相结合。由Kubernetes编排,这种新颖的服务架构桥接了HPC批处理与 service-oriented工作流程之间的差距。我们报告了关于微调管道和高度可用推理服务的初始调查,分析了相关权衡同时提高用户生产力。我们的发现为在超级计算机中集成“AI工厂”服务和工作流程提供了蓝图,支持AI创新融入端到端的科学和工业用例。

关键词

引用

@article{arxiv.2604.12599,
  title  = {Beyond Pre-Training: The Full Lifecycle of Foundation Models on HPC Systems},
  author = {Dino Conciatore and Elia Oggian and Federico Da Forno and Stefano Schuppli and Jerome Tissieres and Joost VandeVondele and Maxime Martinasso},
  journal= {arXiv preprint arXiv:2604.12599},
  year   = {2026}
}