中文

A64FX 上 SpMV 与格点 QCD 的 ECM 建模与性能调优

性能 2021-08-05 v2 分布式、并行与集群计算 高能物理 - 格点

摘要

A64FX CPU 可以说是迄今为止最强大的基于 Arm 的处理器设计。尽管它是传统的基于缓存的多核处理器,其峰值性能和内存带宽可与加速器件媲美。对于希望充分发挥其潜力的开发者而言,良好理解其性能特征至关重要。我们在足够细致的架构层面上对富士 FX1000 超级计算机中使用的 A64FX 进行分析,从而能够构建稳态循环的 Execution-Cache-Memory(ECM)性能模型。在此过程中,我们识别出指向可行通用优化策略的架构特性。在使用简单流循环验证模型后,我们将获得的见解应用于稀疏矩阵-向量乘法(SpMV)和来自量子色动力学(QCD)的域墙(DW)核。对于 SpMV,我们展示了为何 CRS 矩阵存储格式在该架构上不是良好的实际选择,以及 SELL-C-sigma 格式如何实现带宽饱和。对于 DW 核,我们提供缓存复用分析,并展示对复数数组适当选择数据布局如何在此情况下也能实现内存带宽饱和。与最先进的高端 Intel Cascade Lake AP 和 Nvidia V100 系统的比较将 A64FX 的能力置于恰当视角。我们还利用 Fugaku 系统提供的调优旋钮探索功耗优化潜力,对 SpMV 实现约 31% 的节能,对 DW 实现 18% 的节能。

关键词

引用

@article{arxiv.2103.03013,
  title  = {ECM modeling and performance tuning of SpMV and Lattice QCD on A64FX},
  author = {Christie Alappat and Nils Meyer and Jan Laukemann and Thomas Gruber and Georg Hager and Gerhard Wellein and Tilo Wettig},
  journal= {arXiv preprint arXiv:2103.03013},
  year   = {2021}
}

备注

32 pages, 25 figures, 6 tables