中文

从基于任务的GPU工作聚合到恒星并合:将细粒度CPU任务转化为可移植GPU核函数

分布式、并行与集群计算 2023-03-07 v2

摘要

满足可扩展性和性能可移植性要求对任何HPC应用都是一项挑战,尤其是对于自适应加密细化(AMR)的应用。在Octo-Tiger(一个用于模拟恒星并合的天体物理应用)中,我们通过现有方案应对这一挑战:我们采用HPX获得细粒度任务,以便轻松分配工作并精细重叠通信与计算。对于计算本身,我们使用Kokkos将这些任务转化为能够在从少量CPU核心到强大加速器的硬件上运行的 compute 核函数。然而,存在一个缺失环节:虽然HPX暴露的细粒度并行性有利于可扩展性,但当任务过小而无法饱和设备时,会阻碍GPU性能,导致资源利用率低下。为弥补这一差距,我们在Octo-Tiger中研究了多种不同的GPU工作聚合策略,新增了一种策略,并评估了其在近期AMD和NVIDIA GPU上的节点级性能影响,获得了显著的加速。

关键词

引用

@article{arxiv.2210.06438,
  title  = {From Task-Based GPU Work Aggregation to Stellar Mergers: Turning Fine-Grained CPU Tasks into Portable GPU Kernels},
  author = {Gregor Daiß and Patrick Diehl and Dominic Marcello and Alireza Kheirkhahan and Hartmut Kaiser and Dirk Pflüger},
  journal= {arXiv preprint arXiv:2210.06438},
  year   = {2023}
}