HPC 认知仿真能否实现解聚?
分布式、并行与集群计算
2021-12-13 v1
摘要
认知仿真(CogSim)是一种重要且新兴的 HPC 科学探索与科学机器学习(SciML)工作流。CogSim 的一项挑战性工作负载是用一个快速的、学习得到的代理模型替换复杂物理仿真中的一个组件,该模型位于计算循环“内部”。这种循环内推理的执行尤其具有挑战性,因为它需要跨多个可能目标模型进行频繁推理,可能处于仿真关键路径上(延迟受限),受到来自多个 MPI 秩的请求,且通常每次请求仅包含少量样本。本文中我们探索将大型、专用的深度学习/AI 加速器与计算节点解聚后用于此 CogSim 工作负载。我们比较了在这些加速器与领军级 HPC 系统上节点本地 GPU 加速器之间使用的权衡。
引用
@article{arxiv.2112.05216,
title = {Is Disaggregation possible for HPC Cognitive Simulation?},
author = {Michael R Wyatt and Valen Yamamoto and Zoe Tosi and Ian Karlin and Brian Van Essen},
journal= {arXiv preprint arXiv:2112.05216},
year = {2021}
}