中文

通过算法-架构协同设计高效实现 Givens 旋转以加速 QR 分解

分布式、并行与集群计算 2018-03-26 v2 硬件体系结构 数学软件

摘要

我们提出了基于广义 Givens 旋转 (GGR) 的 QR 分解的高效实现,其在 Gflops/watt 性能上相比多核和通用图形处理单元 (GPGPU) 上最先进的实现提升了 3-100 倍。GGR 是对经典 Givens 旋转 (GR) 运算的改进,可同时消去输入矩阵行与列的多个元素。与 GR 相比,GGR 的乘法次数减少 33%。针对 GGR 的定制实现,我们识别其中的宏操作,并在紧耦合到处理单元 (PE) 流水线的可重构数据通路 (RDP) 上实现。在 PE 中,GGR 相比文献中提出的改进 Householder 变换 (MHT) 获得了 1.1 倍的加速。对于 GGR 的并行实现,我们使用可扩展大规模并行粗粒度可重构架构 REDEFINE,并表明所获得的加速与 REDEFINE 中的硬件资源相称。GGR 在 Gflops/watt 上还以 10% 的优势优于通用矩阵乘法 (gemm),这有违直觉。

关键词

引用

@article{arxiv.1803.05320,
  title  = {Efficient Realization of Givens Rotation through Algorithm-Architecture Co-design for Acceleration of QR Factorization},
  author = {Farhad Merchant and Tarun Vatwani and Anupam Chattopadhyay and Soumyendu Raha and S K Nandy and Ranjani Narayan and Rainer Leupers},
  journal= {arXiv preprint arXiv:1803.05320},
  year   = {2018}
}