最先进加速器上 OpenMP 卸载的可移植性与可扩展性
分布式、并行与集群计算
2023-05-16 v2
摘要
在过去十年中,计算能力的大部分提升来自加速多核架构的进展,主要体现为 GPGPU。尽管加速器在各种计算任务中实现了卓越性能,其使用需要代码适配与转换。因此,科学计算应用中最常见的多线程标准 OpenMP 自 v4.0 起引入了主机(CPU)与加速器之间的卸载能力,并在后续的 v4.5、v5.0、v5.1 以及最新 v5.2 版本中不断增强支持。近期,两款最先进的 GPU——Intel Ponte Vecchio Max 1100 与 NVIDIA A100 GPU——分别随 oneAPI 与 NVHPC 编译器推向市场用于卸载。本工作中,我们给出 OpenMP 向这些设备卸载能力的早期性能结果,具体分析高级指令的可移植性(使用 SOLLVE 的 OMPVV 测试套件)以及硬件在代表性科学迷你应用(LULESH 基准)中的可扩展性。我们的结果表明,在最新的 NVHPC 与 oneAPI 工具中,对 4.5 版本的支持覆盖率均近乎完整。然而,我们观察到对 5.0、5.1 和 5.2 版本缺乏支持,在使用 NVHPC 时尤为明显。从性能角度看,我们发现 PVC1100 与 A100 在 LULESH 基准上相对可比。虽然 A100 因更快的内存带宽而略优,但 PVC1100 凭借更大的内存容量可扩展地达到下一问题规模(400^3)。
引用
@article{arxiv.2304.04276,
title = {Portability and Scalability of OpenMP Offloading on State-of-the-art Accelerators},
author = {Yehonatan Fridman and Guy Tamir and Gal Oren},
journal= {arXiv preprint arXiv:2304.04276},
year = {2023}
}
备注
13 pages, 5 Figures, 5 Tables