中文

接近最优的 Wafer-Scale Reduce

分布式、并行与集群计算 2024-09-04 v4 性能

摘要

高性能计算(HPC)应用的有效 Reduce 和 AllReduce 通信集合是关键基石。我们对 Cerebras Wafer-Scale Engine(WSE)上的 Reduce 和 AllReduce 进行首次系统性调查。该架构已被证明在机器学习工作负载和其他计算问题(如 FFT)方面实现了空前性能。我们引入了性能模型来估算在 WSE 上运行算法的执行时间,并对广泛范围的输入大小进行实验验证。除了现有实现外,我们设计并实现了几个专为该架构量身定制的新算法。此外,我们为 WSE 上的 Reduce 操作建立了运行时间下界。基于我们的模型,我们自动生成代码,实现了整个输入大小范围内接近最优的性能。实验表明,我们新的 Reduce 和 AllReduce 算法相较于当前供应商解决方案提高了最高可达 3.27 倍。此外,我们的模型预测性能误差小于 4%。 proposed communication collectives 增加了 HPC 应用程序从众从 WSE 高吞吐量中受益的范围。我们模型驱动的方法展示了一种纪律性的方法,可为 wafer-scale 架构上的进一步算法突破指明道路。

关键词

引用

@article{arxiv.2404.15888,
  title  = {Near-Optimal Wafer-Scale Reduce},
  author = {Piotr Luczynski and Lukas Gianinazzi and Patrick Iff and Leighton Wilson and Daniele De Sensi and Torsten Hoefler},
  journal= {arXiv preprint arXiv:2404.15888},
  year   = {2024}
}