用于深度学习训练和推理的GPU性能预测
机器学习
2024-12-13 v3 性能
摘要
深度学习内核具有可预测的内存访问和计算模式,使其并行架构的GPU特别适合其执行。针对GPU的软件和运行时系统经过优化,以更好地利用流式多处理器、片上缓存和外部高带宽内存。随着深度学习模型和GPU的演变,获取较新GPU的机会有限,这引发了关于新模型架构在现有GPU上的性能、现有模型在新GPU上的性能以及新模型架构在新GPU上的性能的问题。为解决这些问题,我们引入NeuSight,一个预测各种深度学习模型(用于训练和推理)在未见GPU上性能的框架,而无需实际执行。该框架利用GPU硬件行为和软件库优化来估计端到端性能。以前的工作使用捕获线性趋势或多层感知机的回归模型来预测GPU上深度学习内核的总体延迟。这些方法在预测未见模型和新GPU上的性能时存在更高的误差百分比。相反,NeuSight将预测问题分解为更小的子问题,通过基本性能法则来限制预测。NeuSight将单个深度学习内核预测分解为称为瓦片的较小工作集,这些工作集在GPU上独立执行。通过机器学习方法确定瓦片级别的预测,并聚合以估计端到端延迟。NeuSight在各种深度学习工作负载和最新GPU上均优于先前工作。它将GPT3模型在H100上进行训练和推理延迟的误差百分比从121.4%和30.8%降低到2.3%,与最先进的先前工作相比,两个模型都未用于训练框架。
引用
@article{arxiv.2407.13853,
title = {Forecasting GPU Performance for Deep Learning Training and Inference},
author = {Seonho Lee and Amar Phanishayee and Divya Mahajan},
journal= {arXiv preprint arXiv:2407.13853},
year = {2024}
}
备注
Accepted at the 30th ACM International Conference on Architectural Support for Programming Languages and Operating Systems (ASPLOS), 2025