FLAPW方法中哈密顿矩阵与重叠矩阵的CPU-GPU混合生成
计算工程、金融与科学
2016-11-03 v1 分布式、并行与集群计算
性能
摘要
在本文中,我们专注于将高性能数值库集成到第一性原理代码中,以及性能与可扩展性的可移植性。我们工作的目标是FLEUR,这是尤利希研究中心(Forschungszentrum Jülich)在二十年间开发的一款用于电子结构计算的软件。本文所述工作延续了先前通过以高度优化的库重新工程和重写来现代化遗留代码的努力。我们展示了这一获取高效且可移植的共享内存代码的初步努力如何实现代码向新兴异构架构的快速移植。更具体地说,我们将代码移植到配备多个GPU的节点上。我们将研究分为两部分。首先,我们展示了通过将部分计算卸载到GPU上,进行微小且相对直接的代码更改所获得的显著加速。然后,我们确定了进一步提升性能和可扩展性的可能改进。在由16核和2个GPU组成的系统上,我们观察到相对于我们优化的共享内存代码最高达5倍的加速,这相对于原始FLEUR代码意味着7.5倍至12.5倍的加速。
引用
@article{arxiv.1611.00606,
title = {Hybrid CPU-GPU generation of the Hamiltonian and Overlap matrices in FLAPW methods},
author = {Diego Fabregat-Traver and Davor Davidović and Markus Höhnerbach and Edoardo Di Napoli},
journal= {arXiv preprint arXiv:1611.00606},
year = {2016}
}