中文

重新审视时序分块模板优化

分布式、并行与集群计算 2023-05-15 v1

摘要

迭代模板广泛应用于高性能计算(HPC)各类应用中。鉴于 GPU 加速超级计算机的普及,许多工作致力于优化模板 GPU 核函数。为改善数据局部性,时序分块是一种将一批时间步组合在一起处理的优化方法。基于 GPU 在某些方面正演化得类似 CPU 的观察,我们重新审视面向 GPU 的时序分块优化。我们探索如何将时序分块方案适配到近期 Nvidia GPU 的新特性,包括大容量暂存存储器、硬件预取和全设备同步。我们提出了一种新颖的时序分块方法 EBISU,其以低设备占用率为特色,在按块执行的大区块上驱动激进的深度时序分块。我们将 EBISU 与最先进的时序分块库 STENCILGEN 和 AN5D 进行比较,也与配备时序分块优化的最先进模板自动调优工具 ARTEMIS 和 DRSTENCIL 进行比较。在广泛的模板基准测试中,EBISU 相较各模板基准中最优的现有最佳性能实现了最高 2.532.53x 的加速比以及 1.491.49x 的几何平均加速比。

关键词

引用

@article{arxiv.2305.07390,
  title  = {Revisiting Temporal Blocking Stencil Optimizations},
  author = {Lingqi Zhang and Mohamed Wahib and Peng Chen and Jintao Meng and Xiao Wang and Toshio Endo and Satoshi Matsuoka},
  journal= {arXiv preprint arXiv:2305.07390},
  year   = {2023}
}

备注

This paper will be published in 2023 International Conference on Supercomputing (ICS23)