中文

PROFET:面向 GPU 云实例的基于性能剖析的 CNN 训练延迟预测器

分布式、并行与集群计算 2022-11-22 v2

摘要

训练卷积神经网络(CNN)模型通常需要大量算力,云计算资源被广泛用作训练环境。然而,由于云服务快速演进,CNN 算法开发者难以跟进系统更新并将其应用于自身训练环境。因此,云计算服务供应商设计并交付面向各类训练任务的最优训练环境,以减轻算法开发者的系统运维管理开销,显得十分重要。为实现该目标,我们提出 PROFET,它可预测任意 CNN 实现在各种图形处理单元(GPU)设备上的训练延迟,从而构建具成本效益且省时的训练云环境。与以往训练延迟预测工作不同,PROFET 不依赖 CNN 架构的实现细节,且适用于公有云环境。充分评估表明 PROFET 相较最先进相关工作具有更优预测精度,演示服务则展现了所提系统的实用性。

关键词

引用

@article{arxiv.2208.05130,
  title  = {PROFET: Profiling-based CNN Training Latency Prophet for GPU Cloud Instances},
  author = {Sungjae Lee and Yoonseo Hur and Subin Park and Kyungyong Lee},
  journal= {arXiv preprint arXiv:2208.05130},
  year   = {2022}
}

备注

9 pages