生产力与性能兼得:A64FX 上的 Julia
分布式、并行与集群计算
2022-10-20 v1
摘要
基于 ARM 的富士通 A64FX 处理器用于日本的 Fugaku 和英国的 Isambard 2 等超级计算机,提供了可扩展向量扩展(SVE)以及原生支持精简精度浮点运算等有趣的硬件特性组合。本文的目标是探索 Julia 编程语言在 A64FX 处理器上的性能,特别关注精简精度。在此,我们给出关于 axpy 的性能研究以验证编译流水线,表明 Julia 可匹配调优库的性能。此外,我们在 Fugaku 上考察了消息传递接口(MPI)的可扩展性与吞吐量分析,显示 Julia 的 MPI 接口几乎无显著开销。为探索 Julia 面向多种浮点精度的可用性,我们给出了 ShallowWaters.jl(一个可在多种精度级别执行的浅水模型)的结果。即便对于此类复杂应用,Julia 的类型灵活编程范式也同时提供了生产力与性能。
引用
@article{arxiv.2207.12762,
title = {Productivity meets Performance: Julia on A64FX},
author = {Mosè Giordano and Milan Klöwer and Valentin Churavy},
journal= {arXiv preprint arXiv:2207.12762},
year = {2022}
}
备注
7 pages, 8 figures, accepted by EAHPC-2022 - Embracing Arm for High Performance Computing Workshop