基于 SYCL 将批处理迭代求解器移植到 Intel GPU
分布式、并行与集群计算
2023-09-28 v3
摘要
批处理线性求解器在计算科学中发挥着至关重要的作用,尤其在等离子体物理与燃烧模拟领域。随着 Aurora 超级计算机及其他配备 Intel GPU 的即将部署系统的来临,迫切需要将此类求解器的能力扩展至 Intel GPU 架构。本文中,我们展示了使用 SYCL 编程模型在 Intel GPU 上移植并优化批处理迭代求解器的工作。这些新求解器在 Intel GPU Max 1550(Ponte Vecchio GPU)上取得了令人印象深刻的性能,对于 PeleLM 应用输入,其平均性能超越我们此前在 NVIDIA H100 GPU 上的 CUDA 实现达 2.4 倍。通过 Ginkgo 库,这些批处理求解器已可用于实际科学应用的生产环境,并补充了 Ginkgo 批处理功能的性能可移植性。
引用
@article{arxiv.2308.08417,
title = {Porting Batched Iterative Solvers onto Intel GPUs with SYCL},
author = {Phuong Nguyen and Pratik Nayak and Hartwig Anzt},
journal= {arXiv preprint arXiv:2308.08417},
year = {2023}
}
备注
11 pages, 8 figures