中文

整数矩阵乘法单元上的双精度通用矩阵乘法

分布式、并行与集群计算 2024-04-02 v4

摘要

深度学习硬件通过降低计算精度并专用于矩阵乘法来实现高吞吐量与低功耗。对于机器学习推理,定点值计算十分常见,其中输入与输出值及模型参数均被量化。因此,许多处理器现已配备快速整数矩阵乘法单元(IMMU)。寻找一种利用这些 IMMU 提升 HPC 应用性能同时保持精度的方法具有重要意义。我们聚焦于 Ozaki 方案,其利用低精度计算单元计算高精度矩阵乘法,并展示了使用 IMMU 的优劣。使用整数 Tensor Cores 的实验表明,在 NVIDIA 消费级 GPU 上,我们计算双精度矩阵乘法比 cuBLAS 及现有基于 FP16 Tensor Cores 的 Ozaki 方案实现更快。此外,我们展示了在保持 FP64 精度下将量子电路模拟加速至多 4.33 倍。

关键词

引用

@article{arxiv.2306.11975,
  title  = {DGEMM on Integer Matrix Multiplication Unit},
  author = {Hiroyuki Ootomo and Katsuhisa Ozaki and Rio Yokota},
  journal= {arXiv preprint arXiv:2306.11975},
  year   = {2024}
}

备注

Accepted by IJHPCA: https://journals.sagepub.com/doi/10.1177/10943420241239588