将 TensorFlow 作为基于模板计算在 Cerebras 晶圆级引擎上的 DSL
分布式、并行与集群计算
2022-10-11 v1 性能
摘要
Cerebras 晶圆级引擎(WSE)是一种将数十万个 AI 核集成于单芯片的加速器。尽管该技术为机器学习工作负载而设计,其可观的原始计算量也使其成为加速传统 HPC 计算代码的极具吸引力的潜在目标。此类算法多为基于模板的,其更新操作涉及邻域元素的贡献;本文作为该技术的早期采用者,从与 CPU 和 GPU 对比的视角探讨该技术对此类代码的适用性。以 TensorFlow 为接口,我们探究其性能并表明:尽管在向用户开放编程接口方面仍有工作待完成,WSE 性能令人印象深刻——在我们的实验中,其性能超越四块 V100 GPU 达 2.5 倍,超越两颗 Intel Xeon Platinum CPU 约 114 倍。因此,该技术在未来 exascale 超级计算机上加速 HPC 代码具有显著潜力。
引用
@article{arxiv.2210.04795,
title = {TensorFlow as a DSL for stencil-based computation on the Cerebras Wafer Scale Engine},
author = {Nick Brown and Brandon Echols and Justs Zarins and Tobias Grosser},
journal= {arXiv preprint arXiv:2210.04795},
year = {2022}
}
备注
This preprint has not undergone any post-submission improvements or corrections. Preprint of paper submitted to Euro-Par DSL-HPC workshop