晶圆级处理器上的快速模板代码计算
分布式、并行与集群计算
2020-10-09 v1
摘要
对于偏微分方程(PDE)代码,基于 CPU 和基于 GPU 的系统性能往往较低,这类代码需要求解大型、稀疏且通常结构化的线性方程组。迭代求解器受限于数据移动,包括缓存与内存之间以及节点之间的数据移动。在此,我们描述了在 Cerebras Systems CS-1(一种具有内存带宽和通信延迟优势以良好运行的晶圆级处理器)上求解此类方程组的方法。我们在单个晶圆级系统上通过 BiCGStab 求解由 600×595×1536 网格上 7 点有限差分模板产生的线性系统,实现了 0.86 PFLOPS 的性能,达到该机器峰值性能约三分之一。我们解释了该系统、其架构与编程,以及其在此问题及相关问题上的性能。我们讨论了内存容量与浮点精度问题。我们概述了将此项工作扩展到完整应用的计划。
引用
@article{arxiv.2010.03660,
title = {Fast Stencil-Code Computation on a Wafer-Scale Processor},
author = {Kamil Rocki and Dirk Van Essendelft and Ilya Sharapov and Robert Schreiber and Michael Morrison and Vladimir Kibardin and Andrey Portnoy and Jean Francois Dietiker and Madhava Syamlal and Michael James},
journal= {arXiv preprint arXiv:2010.03660},
year = {2020}
}
备注
SC 20: The International Conference for High Performance Computing, Networking, Storage, and Analysis, to appear