中文

SAIH:一种用于理解 HPC 系统上 AI 性能趋势的可扩展评估方法

分布式、并行与集群计算 2022-12-08 v1 人工智能 性能

摘要

新颖的人工智能(AI)技术已加速了许多科学研究,如宇宙学、物理学与生物信息学,不可避免地成为高性能计算(HPC)系统上的一类重要工作负载。现有 AI 基准倾向于定制广受认可的 AI 应用,从而在预定义问题规模(就数据集与 AI 模型而言)下评估 HPC 系统的 AI 性能。由于缺乏问题规模的可扩展性,静态 AI 基准可能不足以帮助理解不断演进的 AI 应用(尤其是大规模系统上的科学 AI 应用)在 HPC 系统上的性能趋势。本文中,我们提出一种可扩展评估方法(SAIH),通过缩放定制 AI 应用的问题规模来分析 HPC 系统的 AI 性能趋势。为实现可扩展性,SAIH 构建了一组用于增大问题规模的新机制。随着数据与模型持续缩放,我们可以研究 HPC 系统上 AI 性能的趋势与范围,并进一步诊断系统瓶颈。为验证我们的方法,我们增强了一个宇宙学 AI 应用来评估一个配备 GPU 的真实 HPC 系统,作为 SAIH 的案例研究。

关键词

引用

@article{arxiv.2212.03410,
  title  = {SAIH: A Scalable Evaluation Methodology for Understanding AI Performance Trend on HPC Systems},
  author = {Jiangsu Du and Dongsheng Li and Yingpeng Wen and Jiazhi Jiang and Dan Huang and Xiangke Liao and Yutong Lu},
  journal= {arXiv preprint arXiv:2212.03410},
  year   = {2022}
}

备注

14 pages