中文

基于GPU的扫掠时空分解性能初步研究

计算物理 2017-01-05 v2 分布式、并行与集群计算 数学软件

摘要

物理现象的模拟对于航空航天及其他高科技产业中精密部件的快速设计至关重要。这些现象常由涉及无精确解偏微分方程(PDEs)的数学模型描述。现代设计问题所需的模拟分辨率,即便在有效并行化的求解器中,也难以在合理时间内实现。尽管相对于可用算力的规模是加速这些应用的最大障碍,但通过仔细关注内存访问细节可获得显著性能提升。并行化PDE求解器在内存管理上面临权衡:将每个时间步的解存储在充裕但访问成本高的全局内存中,或存储在有限但访问成本低且必须在节点间传递的私有内存中。此处提出的扫掠时空分解的GPU实现通过使用私有(共享)内存、避免节点间通信以及覆盖不必要的值来缓解这一困境。它在一维PDE求解器的执行时间上显示出显著改进,与朴素GPU版本相比,大和小问题规模分别实现6-2x加速,与并行CPU版本相比实现7-300x加速。

关键词

引用

@article{arxiv.1612.02495,
  title  = {An initial investigation of the performance of GPU-based swept time-space decomposition},
  author = {Daniel Magee and Kyle E Niemeyer},
  journal= {arXiv preprint arXiv:1612.02495},
  year   = {2017}
}

备注

14 pages; submitted to 2017 AIAA SciTech Forum