中文

当前GPU上Tall and Very Skinny矩阵QR分解的实现

数学软件 2026-03-24 v1 数值分析 数值分析

摘要

我们考虑计算实数稠密Tall and Very Skinny矩阵的QR(或QZ)分解的问题,即列数远小于行数的矩阵,使得大多数计算要么完全要么部分受内存带宽限制。论文聚焦于仍支持64位浮点运算的最新NVIDIA GPGPU,但发现同样适用于AMD GPU。我们讨论了两种基本算法:基于常规方程(格拉姆矩阵)的方法,特别是Cholesky-QR2和SVQB;以及基于树化约简方案中Householder变换的“Tall-Skinny QR”(TSQR)。我们提出了两种主要优化技术:消除Q因子的写回(“Q-less QR”),以及利用快速局部存储(GPU上的共享存储器)。我们比较了基于格拉姆方法的直观实现与更为精细的TSQR实现,围绕实现性能、求解时间和实现复杂度进行比较。通过性能建模和数值实验(包括我们自己的代码和供应商优化的库例程),我们展示了在此内存受限至过渡(内存/计算受限) regime 中,专用方法和实现至关重要,TSQR在求解时间方面具有竞争力,但需要投入低层代码优化的成本。

关键词

引用

@article{arxiv.2603.20889,
  title  = {Implementation of QR factorization of tall and very skinny matrices on current GPUs},
  author = {Jonas Thies and Melven Röhrig-Zöllner},
  journal= {arXiv preprint arXiv:2603.20889},
  year   = {2026}
}

备注

submitted to the Euro-Par 2026 proceedings