中文

理解最新 ML 工作负载的性能天花板:非 GEMM 工作负载

硬件体系结构 2025-04-17 v5 机器学习 性能

摘要

在当今 ML 运算符中,基于广义矩阵乘法(GEMM)的运算符被认为是构成 ML 模型主干的关键运算符。由于其计算开销占总体执行时间的主导比例(例如,我们的结果中占 42.8% - 96.6%),GEMM 运算符一直是快速 ML 推理的主要优化目标。这导致当今可用的高级 GPU 和加速器显著提升了 GEMM 性能,相较于 CPU 实现。然而,加速 GEMM 显著改变了 Amdahl 定律在 ML 推理中的格局;由于 GEMM 执行时间显著降低,非 GEMM 运算符的相对执行时间现在变得重要。尽管非 GEMM 性能的重要性不断上升,但我们对最新硬件平台和模型中非 GEMM 性能天花板了解甚少。因此,为指导非 GEMM 优化,我们对 17 个广泛采用的 ML 模型在 Hugging Face 和 Torchvision 中的性能进行彻底分析,分别在带有和不带有 GPU 的工作站和数据中心平台上进行测试。我们发现,非 GEMM 性能瓶颈在所有平台和模型中都属于一个相当大的问题,平均而言,占总延迟的 11.3% - 73.6%。当我们应用量化技术(一种常见的模型压缩方法)时,这一挑战显著恶化,由于 GEMM 性能的提升以及用于去量化和重新量化的额外非 GEMM 运算符。为提供关于非 GEMM 优化目标的见解,我们解析了每个模型和部署软件中最具代表性的非 GEMM 运算符。我们还展示了广泛采用的优化措施(如算子融合)并不能完全解决非 GEMM 性能瓶颈,后者仍占总延迟的 15% - 48%。

关键词

引用

@article{arxiv.2404.11788,
  title  = {Understanding the Performance Horizon of the Latest ML Workloads with NonGEMM Workloads},
  author = {Rachid Karami and Sheng-Chun Kao and Hyoukjun Kwon},
  journal= {arXiv preprint arXiv:2404.11788},
  year   = {2025}
}