GPU集群上的区域分解方法
高能物理 - 格点
2010-11-16 v1 数学软件
摘要
由于缺乏直接的数据交换设施,用于格点QCD模拟的并行GPGPU计算在GPU到GPU的数据通信上存在瓶颈。在这项工作中,我们研究了在低成本GPU集群上使用受限加性Schwarz(RAS)预条件子的夸克求解器的性能。我们期望具有适当区域分解和任务分配的RAS预条件子能够减少通信瓶颈。我们构建的GPU集群由四个PC机箱组成,每个机箱连接两块GPU卡,总共八块GPU卡。计算节点通过速度较慢但成本低廉的千兆以太网连接。我们在混合精度嵌套BiCGStab算法的单精度部分中加入了RAS预条件子,并将单精度任务分配到多个GPU上。基准测试是在大小为的随机生成规范配置上使用改进的Wilson夸克进行的。我们观察到,与不使用预条件子相比,使用RAS预条件子后求解器性能提升了两倍,并且发现这种提升主要源于我们预期的通信瓶颈的减少。
引用
@article{arxiv.1011.3318,
title = {Domain Decomposition method on GPU cluster},
author = {Yusuke Osaki and Ken-Ichi Ishikawa},
journal= {arXiv preprint arXiv:1011.3318},
year = {2010}
}
备注
7 pages, 1 figure, Lattice 2010 Proceeding