利用 TestSNAP 与 LAMMPS 在先进架构上快速探索优化策略
分布式、并行与集群计算
2020-11-26 v1 性能
摘要
随着 Aurora 与 Frontier 机器的发布,百亿亿次(exascale)竞赛已告结束。新一代超级计算机利用多样化的硬件架构来实现其计算性能,给应用的可移植性能带来了额外负担。若非性能可移植框架的演进——其为将抽象并行层次映射到多样架构提供了统一模型——编程模型的日益碎片化将带来复合式的优化挑战。应对该挑战的方案是性能可移植框架的演进,其为将抽象并行层次映射到多样架构提供统一模型。Kokkos 即是面向 C++ 应用的此类性能可移植编程模型,为各主要 HPC 平台提供后端实现。即便拥有性能可移植框架,重构算法以暴露更高程度的并行性也非易事。谱邻分析势(Spectral Neighbor Analysis Potential, SNAP)是一种用于前沿分子动力学模拟的机器学习原子间势。SNAP 计算的先前实现在新一代 CPU 上相对于峰值性能呈下降趋势,且在 GPU 上性能低下。本文描述了在 LAMMPS 分子动力学包的 Kokkos CUDA 后端中所实现的 SNAP 的重构与优化,并在 NVIDIA GPU 上进行了基准测试。我们识别出新型层次并行模式,从而最小化内存访问开销并将实现推入计算饱和状态。我们通过 Kokkos 的实现可在即将到来的架构上实现重新编译即运行的高效性。对于一项重要基准测试,在 NVIDIA Tesla V100-16GB 上测得,我们相对现有实现取得了约 22x 的求解时间改进。
引用
@article{arxiv.2011.12875,
title = {Rapid Exploration of Optimization Strategies on Advanced Architectures using TestSNAP and LAMMPS},
author = {Rahulkumar Gayatri and Stan Moore and Evan Weinberg and Nicholas Lubbers and Sarah Anderson and Jack Deslippe and Danny Perez and Aidan P. Thompson},
journal= {arXiv preprint arXiv:2011.12875},
year = {2020}
}
备注
Submitted to IPDPS 2021, October 19, 2020