用于稀疏矩阵乘法的 DBCSR 库向 Intel Xeon Phi 系统的移植
分布式、并行与集群计算
2018-03-13 v2
摘要
两个稀疏矩阵的乘法是模拟包含数千个原子和电子的系统的电子结构时的关键运算。高度优化的稀疏线性代数库 DBCSR(Distributed Block Compressed Sparse Row)专门被设计用于高效执行此类稀疏矩阵乘法。该库是 CP2K 中线性标度电子结构理论和低标度关联方法的基本构建模块。它使用 MPI 和 OpenMP 进行并行化,并可通过 CUDA 利用 GPU 加速器。我们描述了 DBCSR 在配备 Intel Xeon Phi Knights Landing (KNL) 处理器的系统上与配备 Intel Xeon CPU 的系统(包括配备 GPU 的系统)的性能比较。我们发现,在相同节点数下,基于 Cray XC40 KNL 的系统上的 DBCSR 比配备 Nvidia P100 卡的混合 Cray XC50 系统慢 11%-14%。而与配备双路 Intel Xeon CPU 的 Cray XC40 系统相比,KNL 的速度提升高达 24%。
引用
@article{arxiv.1708.03604,
title = {Porting of the DBCSR library for Sparse Matrix-Matrix Multiplications to Intel Xeon Phi systems},
author = {Iain Bethune and Andeas Gloess and Juerg Hutter and Alfio Lazzaro and Hans Pabst and Fiona Reid},
journal= {arXiv preprint arXiv:1708.03604},
year = {2018}
}
备注
Submitted to the ParCo2017 conference, Bologna, Italy 12-15 September 2017