超越 IEEE-754 SGEMM 的数值与性能特征:基于 BF16 Tensor Core 的 GPU 科学计算
分布式、并行与集群计算
2026-05-19 v1
摘要
由于其增强的本机数值强度和能源效率,减少精度浮点计算资源——主要用于人工智能(AI)应用——的增长速度远快于其高精度版本。这导致了各种努力专注于利用丰富的减少精度硬件来模拟更高精度的数学计算。本文研究了一种具体用例,即在单精度(FP32)矩阵乘法中利用现代 GPU 上的 bfloat16(BF16)Tensor Core。鉴于 BF16 和 FP32 共享相同的动态范围、将 BF16 操作累积到 FP32 累加器(以全速)的选项,以及 Blackwell GPU 架构中针对 BF16 算术特性的额外优势(如集成缩放硬件),此类仿真具有高度的动机。本文检验了通过 BF16 实现的 FP32 矩阵乘法的性能、效率、能源和数值特征,证明了其超越本机 FP32 在科学应用中的数值和性能特征。我们还讨论了正确处理非规范数的完整库就绪实现。
引用
@article{arxiv.2605.16617,
title = {Exceeding the Numerical and Performance Characteristics of IEEE-754 SGEMM with BFloat16 Tensor Cores on GPUs for Scientific Computing},
author = {Harun Bayraktar and Cole Brower and John Gunnels and Greg Henry and Cherin Joseph and Jack Kosaian and Dmitry Lyakh and Lukas Mosimann and Victor Podlozhnyuk and Addison Richards and Paul Springer and Haicheng Wu},
journal= {arXiv preprint arXiv:2605.16617},
year = {2026}
}