网格计算环境中高瘦矩阵的QR分解
分布式、并行与集群计算
2016-11-15 v1 数值分析
摘要
先前的研究报告指出,常见的稠密线性代数运算无法通过使用计算网格的多个地理站点来获得加速。由于此类运算是大多数科学应用的基础模块,传统超级计算机在高性能计算中仍然占据主导地位,而网格在加速大规模科学问题中的应用仅限于具有更高层次并行性的应用。我们识别了最先进的稠密线性代数库 ScaLAPACK 中实现的分布式内存算法的两个性能瓶颈。首先,由于 ScaLAPACK 假设通信网络是同构的,其算法实现缺乏通信模式上的局部性。其次,ScaLAPACK 算法发送的消息数量显著多于其他以浮点运算换取通信的算法。在本文中,我们提出了一种在网格计算环境中计算高瘦矩阵的 QR 分解(主要稠密线性代数内核之一)的新方法,该方法克服了这两个瓶颈。我们的贡献在于将最近提出的算法(避免通信的 QR 分解)与拓扑感知中间件(QCG-OMPI)相结合,以将密集通信(ScaLAPACK 调用)限制在不同的地理站点内。在 Grid'5000 平台上进行的实验研究表明,对于大规模问题,所得性能随地理站点数量线性增加(并且始终高于 ScaLAPACK 的性能)。
引用
@article{arxiv.0912.2572,
title = {QR Factorization of Tall and Skinny Matrices in a Grid Computing Environment},
author = {Emmanuel Agullo and Camille Coti and Jack Dongarra and Thomas Herault and Julien Langou},
journal= {arXiv preprint arXiv:0912.2572},
year = {2016}
}
备注
Accepted at IPDPS10. (IEEE International Parallel & Distributed Processing Symposium 2010 in Atlanta, GA, USA.)