中文

DeLTA:基于深度内存系统流量分析的深度学习应用 GPU 性能模型

分布式、并行与集群计算 2020-04-28 v1 机器学习

摘要

训练卷积神经网络(CNNs)需要密集的计算吞吐量与高内存带宽。尤其是卷积层占据了 CNN 训练执行时间的大部分,而 GPU 常被用于加速这些层的工作负载。为高效加速 CNN 训练而进行的 GPU 设计优化,需要准确建模在增加计算和内存资源时其性能如何提升。我们提出 DeLTA,首个精确估计各 GPU 内存层级流量、同时考虑并行卷积算法复杂复用模式的分析模型。我们证明该模型对不同 CNN 与 GPU 架构均准确且鲁棒。随后我们展示如何利用该模型谨慎平衡不同 GPU 资源的扩展,以实现高效的 CNN 性能提升。

关键词

引用

@article{arxiv.1904.01691,
  title  = {DeLTA: GPU Performance Model for Deep Learning Applications with In-depth Memory System Traffic Analysis},
  author = {Sangkug Lym and Donghyuk Lee and Mike O'Connor and Niladrish Chatterjee and Mattan Erez},
  journal= {arXiv preprint arXiv:1904.01691},
  year   = {2020}
}