中文

AI工厂:重新思考云计算与高性能计算之间的鸿沟

分布式、并行与集群计算 2025-09-17 v1 人工智能

摘要

人工智能的战略重要性正在推动全球对主权AI倡议的推进。国家政府越来越多地发展专门的基础设施,称为AI工厂(AIF),以实现技术自主性并获取维持强大本地数字生态系统所需的资源。在欧洲,EuroHPC 联合署正在数亿欧元投资多个AI工厂,这些工厂建立在现有的高性能计算(HPC)超级计算机之上。然而,尽管HPC系统在原始性能方面表现出色,但其本身并非为可用的性、可接入性或作为面向公众的AI服务平台(如推理或智能体应用)而设计。在 contrast 中,AI实践者习惯于云原生技术,如Kubernetes和对象存储,这些工具往往难以集成到传统HPC环境中。本文主张在超级计算机内部采用双堆栈方法:集成HPC和云原生技术。我们的目标是通过结合高性能和硬件加速与易用性和面向服务的前端,弥合HPC与云计算之间的鸿沟。这种融合使两种范例相互放大。为此,我们将研究HPC的云计算挑战(无服务器HPC)以及云计算技术的HPC挑战(高性能云)。

关键词

引用

@article{arxiv.2509.12849,
  title  = {AI Factories: It's time to rethink the Cloud-HPC divide},
  author = {Pedro Garcia Lopez and Daniel Barcelona Pons and Marcin Copik and Torsten Hoefler and Eduardo Quiñones and Maciej Malawski and Peter Pietzutch and Alberto Marti and Thomas Ohlson Timoudas and Aleksander Slominski},
  journal= {arXiv preprint arXiv:2509.12849},
  year   = {2025}
}