GPU上的秩k Cholesky上下修正:gpucholmodV0.2
分布式、并行与集群计算
2010-11-05 v1
摘要
本文简要描述了针对流式多处理器架构的Cholesky修正算法。我们的实现采用C++编写,并绑定Matlab,利用CUDA调用图形处理单元(GPU)。由于问题的带宽受限特性,加速效果有限。此外,必须遵循复杂的依赖模式,需要启动多个内核。尽管如此,这构成了一个有趣的问题,与同时期CPU上运行的LINPACK套件相比,我们的方法可将大小为5000×5000且k=16的矩阵的计算时间减少约7倍。然而,由于我们的方法在所需GPU内存上具有O(n)的扩展性,可以处理更大的问题。
引用
@article{arxiv.1011.1173,
title = {Rank k Cholesky Up/Down-dating on the GPU: gpucholmodV0.2},
author = {Christian Walder},
journal= {arXiv preprint arXiv:1011.1173},
year = {2010}
}
备注
7 pages