美国研究机构中高性能计算(HPC)的调查综述
分布式、并行与集群计算
2025-06-25 v1 人工智能
摘要
人工智能、数据密集型科学和数字孪生技术的快速发展,推动了研究生态系统对高性能计算(HPC)的前所未有需求。尽管国家实验室和工业大型云计算服务商已在超算和GPU导向架构方面投入巨资,但大学运营的HPC系统资源相对不足。本综述对美国大学校园内的HPC格局进行全面评估,将其能力与美国能源部(DOE)领导级系统及工业AI基础设施进行基准测试。我们检查了超过50所顶尖研究机构,分析了计算容量、架构设计、治理模式以及能源效率。我们的发现表明,尽管大学计算集群对学术研究至关重要,但其增长轨迹(CAGR约为18%)显著低于国家(约为43%)和工业(约为78%)规模的系统。向GPU稠密AI工作负载的日益倾斜,扩大了能力差距,凸显了联邦计算、闲置GPU收集以及成本共享模型的必要性。我们还识别出去中心化强化学习等新兴范式,作为在校园环境内 democratizing AI 训练的有前景的机会。最终,本工作为学术领导者、资助机构和技术合作伙伴提供了行动指南,确保为支持国家研究优先事项的HPC资源实现更公平、可持续的获取。
引用
@article{arxiv.2506.19019,
title = {Survey of HPC in US Research Institutions},
author = {Peng Shu and Junhao Chen and Zhengliang Liu and Huaqin Zhao and Xinliang Li and Tianming Liu},
journal= {arXiv preprint arXiv:2506.19019},
year = {2025}
}