面向有限差分模板核自动生成的 GPU 支持
分布式、并行与集群计算
2020-08-05 v1
摘要
石油与天然气行业待处理数据的增长与基于模板计算(如全波形反演和逆时偏移)的不断演进算法所提出的需求相匹配。图形处理单元(GPU)因其高度的数据并行性而成为模板计算极具吸引力的架构目标。然而,快速的架构与技术演进使得即便是最熟练的程序员也难以跟上微架构层面的技术进展。在本工作中,我们为旨在生成高度优化的有限差分核以供反演方法使用的开源编译器 Devito 提供了一个扩展。我们将其嵌入 Oxford Parallel Domain Specific Language (OP-DSL),以从高层表示实现面向 GPU 架构的自动代码生成。我们的目标是从符号表示层面编码的用户能够毫不费力地使其实现受益于 GPU 架构的处理能力。所实现的后端在 NVIDIA GTX Titan Z 和 NVIDIA Tesla V100 上,针对带与不带符号优化的 3D 声学各向同性波传播模板核的不同空间阶数离散化,通过屋顶线模型就运算强度进行了评估。对于超过 256 点网格的模板核,其达到了 V100 峰值性能约 63% 以及 Titan Z 峰值性能 24%。我们的研究表明,改善内存使用应是在所评估架构上提升该实现方案性能的最有效策略。
引用
@article{arxiv.1912.00695,
title = {GPU Support for Automatic Generation of Finite-Differences Stencil Kernels},
author = {Vitor Hugo Mickus Rodrigues and Lucas Cavalcante and Maelso Bruno Pereira and Fabio Luporini and István Reguly and Gerard Gorman and Samuel Xavier de Souza},
journal= {arXiv preprint arXiv:1912.00695},
year = {2020}
}
备注
This work was accepted and presented to Latin America High Performance Computing (CARLA 2019)