中文

面向高性能计算中 AI 模型的无缝管理

分布式、并行与集群计算 2022-12-14 v1

摘要

随着人工智能(AI)在各类科学/工程群体中日益普及,AI 模型以前所未有的规模在各领域涌现。然而,鉴于软硬件环境的复杂性与多样性,复用 AI 制品(模型与数据集)极其困难,尤其在 AI 驱动的科学应用中。构建一个能够大规模高效运行与复用 AI 应用/数据集的生态系统,对多样化的科学与工程及高性能计算(HPC)群体愈发关键。本文中,我们改进了 HPC-AI 生态系统——HPCFair,其实现了可发现、可访问、可互操作与可复现(FAIR)原则。HPCFair 支持 AI 模型/数据集的收集,允许用户经认证下载/上传 AI 制品。最重要的是,我们提出的框架提供用户友好 API,使用户能轻松运行推理任务并按需定制 AI 制品至其任务。结果表明,借助 HPCFair API,无论是否具备 AI 技术专长,用户均可极低代价轻松将 AI 制品用于自身任务。

关键词

引用

@article{arxiv.2212.06352,
  title  = {Towards Seamless Management of AI Models in High-Performance Computing},
  author = {Sixing Yu and Murali Emani and Chunhua Liao and Pei-Hung Lin and Tristan Vanderbruggen and Xipeng Shen and Ali Jannesari},
  journal= {arXiv preprint arXiv:2212.06352},
  year   = {2022}
}

备注

Accepted at the 2nd Annual AAAI Workshop on AI to Accelerate Science and Engineering (AI2ASE)