PM2Lat:基于 GPU 架构的深度神经网络执行延迟高度精确预测框架
性能
2026-03-03 v1
摘要
我们提出了 PM2Lat,一个用于在 GPU 上准确预测深度神经网络模型延迟的快速且通用的框架,特别关注 NVIDIA 产品。不同于以往依赖深度学习模型或手工启发式方法的做法,PM2Lat 利用 GPU 的单指令多线程架构来建模 DNN 模型的执行时间。首先,我们通过研究计算行为和内存访问模式,深入探索了细粒度的 GPU 操作建模。随后,我们发现即使 serving 同一目的,不同的 GPU 内核也呈现出显著的性能差异。因此,PM2Lat 的核心思想是依据内核配置进行差别化建模。这种内核感知的建模使 PM2Lat 能够在多样化的数据类型和硬件平台上始终保持低预测误差。此外,PM2Lat 不仅拓展到标准矩阵乘法,还支持复杂的 GPU 内核,如 Triton、Flash Attention 和 Cutlass Attention。实验结果表明,PM2Lat 在 Transformer 模型上在不同数据类型和硬件平台上的误差率始终保持在 10% 以下,对比当前最先进的 NeuSight 在 FP32 上提升 10-20%,在 BF16 上提升至少 50%。当应用于多样化内核时,误差率维持在 3-8%。
引用
@article{arxiv.2603.00549,
title = {PM2Lat: Highly Accurate and Generalized Prediction of DNN Execution Latency on GPUs},
author = {Truong-Thanh Le and Hoang-Loc La and Amir Taherkordi and Frank Eliassen and Phuong Hoai Ha and and Peiyuan Guan},
journal= {arXiv preprint arXiv:2603.00549},
year = {2026}
}