通过 GPU 上块-Krylov 空间求解器的高效实现突破内存带宽限制
高能物理 - 格点
2018-08-09 v2 计算物理
摘要
核物理中的格点量子色动力学模拟已受益于大量算法进展,如多重网格和特征向量缩减。这些改进了求解时间,但并未缓解主导迭代求解器的矩阵-向量运算固有的内存带宽约束。对该运算进行多向量批处理并利用缓存与寄存器分块可带来超线性加速。块-Krylov 求解器可自然利用此类批处理矩阵-向量运算,并通过在多次求解间共享 Krylov 空间进一步减少求解迭代次数。然而,实际实现通常受向量-向量运算数量二次缩放的困扰。利用 QUDA 库,我们提出了一种在 NVIDIA GPU 上实现的块-CG 求解器,将向量-向量运算的内存带宽复杂度从二次降为线性。我们给出了 HISQ 离散化的结果,显示出相比 NVIDIA SaturnV 集群上高度优化的独立 Krylov 求解有 5 倍加速。
引用
@article{arxiv.1710.09745,
title = {Pushing Memory Bandwidth Limitations Through Efficient Implementations of Block-Krylov Space Solvers on GPUs},
author = {M. A. Clark and Alexei Strelchenko and Alejandro Vaquero and Mathias Wagner and Evan Weinberg},
journal= {arXiv preprint arXiv:1710.09745},
year = {2018}
}
备注
15 pages, 14 figures, in press