利用GPU张量核进行双精度欧几里得距离计算
分布式、并行与集群计算
2022-11-21 v2
摘要
张量核(TCs)是一种专用集成电路(ASIC),是近期加入图形处理单元(GPU)架构的组件。因此,TCs 专为大幅提升矩阵乘加(MMA)操作性能而设计。尽管 TCs 在机器学习及密切相关领域中被广泛研究且高效性毋庸置疑,但 MMA 操作并非这些领域独有。更一般地,任何可表达为 MMA 操作的计算都可利用 TCs,并可能受益于相较其他通用核(如 Nvidia GPU 上的 CUDA 核)更高的计算吞吐。在本文中,我们提出了首个双精度(FP64)欧几里得距离计算算法,其表达为 MMA 操作以利用 Nvidia GPU 上的 TCs,而非更常用的 CUDA 核。为展示欧几里得距离可在真实应用中加速,我们在距离相似自连接问题上评估了所提 TC 算法,因为该算法计算最密集的部分在于多维空间中的距离计算。我们发现,使用张量核算法相对 CUDA 核算法的性能增益弱依赖于数据集大小与分布,但强依赖于数据维度。总体而言,TCs 是 CUDA 核的有力替代方案,尤其在数据维度较低()时,因为相较最先进的 GPU 距离相似自连接算法,我们实现了平均 以及最高 的加速。此外,由于本文是最早探索 TCs 用于 FP64 通用计算的工作之一,未来研究前景广阔。
引用
@article{arxiv.2209.11287,
title = {Leveraging GPU Tensor Cores for Double Precision Euclidean Distance Calculations},
author = {Benoit Gallet and Michael Gowanlock},
journal= {arXiv preprint arXiv:2209.11287},
year = {2022}
}
备注
To be published in 2022 29th IEEE International Conference on High Performance Computing, Data, and Analytics