面向张量核上RandNLA的混合精度随机投影
分布式、并行与集群计算
2023-04-11 v1
摘要
随机投影能够在保留数据结构的同时降低数据维度,是当今处理海量数据的机器学习、信号处理与信息检索中的基础工具。RandNLA(随机数值线性代数)利用随机投影降低张量低秩分解与最小二乘问题的计算复杂度。尽管随机投影的计算仅是简单的矩阵乘法,其渐近计算复杂度通常仍大于RandNLA算法中其他操作,因此已有诸多研究提出降低其计算复杂度的方法。我们提出一种在NVIDIA GPU上利用张量核对单精度张量进行快速混合精度随机投影的方法。我们利用随机矩阵所需精度较低的特性,在张量核上开发了高度优化的FP32与FP16矩阵乘法——SHGEMM(单精度与半精度GEMM),其中随机矩阵以FP16存储。相比基线单精度实现,我们的方法在计算随机SVD时快1.28倍,在计算随机投影高阶SVD时快1.75倍,且保持精度。
引用
@article{arxiv.2304.04612,
title = {Mixed-Precision Random Projection for RandNLA on Tensor Cores},
author = {Hiroyuki Ootomo and Rio Yokota},
journal= {arXiv preprint arXiv:2304.04612},
year = {2023}
}
备注
PASC'23