中文

构建GPU上深度学习推荐模型训练的绩效模型

机器学习 2022-11-18 v2 性能

摘要

我们为深度学习推荐模型(DLRM)的GPU训练设计了一个性能模型,与其他优化良好的CV与NLP模型相比,其GPU利用率较低。我们表明设备活跃时间(核函数运行时长之和)与设备空闲时间都是整体设备时间的重要组成。因此我们分别处理二者:(1)灵活采用基于启发式与基于ML的核性能模型用于主导设备活跃时间的算子,(2)将算子开销分为五类以定量确定它们对设备活跃时间的贡献。结合这两部分,我们提出一种基于关键路径的算法,通过遍历DLRM执行图来预测其每批次训练时间。我们在所有核性能建模中达到低于10%的几何平均平均误差(GMAE),在GPU活跃时间预测与含各工作负载开销的整体端到端每批次训练时间预测中分别达到4.61%与7.96%的几何平均误差。跨工作负载共享开销使端到端预测误差轻微增加2.19%,表明在大规模预测中使用共享开销可行。我们展示我们的通用性能模型不仅在高度定制配置且受多因素主导的DLRM上实现低预测误差,也对以往多数方法所针对的其他计算受限ML模型产生可比精度。利用该性能模型与图级数据和任务依赖分析,我们展示我们的系统可比以往方法提供更通用的模型—系统协同设计。

关键词

引用

@article{arxiv.2201.07821,
  title  = {Building a Performance Model for Deep Learning Recommendation Model Training on GPUs},
  author = {Zhongyi Lin and Louis Feng and Ehsan K. Ardestani and Jaewon Lee and John Lundell and Changkyu Kim and Arun Kejariwal and John D. Owens},
  journal= {arXiv preprint arXiv:2201.07821},
  year   = {2022}
}

备注

11 pages, 11 figures. Appears in the 29th IEEE International Conference on High-Performance Computing, Data, and Analytics (HiPC 2022)