中文

深度学习在英特尔众核架构上的性能建模

分布式、并行与集群计算 2019-06-06 v1 机器学习 性能

摘要

许多复杂问题,如自然语言处理或视觉目标检测,都是使用深度学习解决的。然而,针对大型数据集对复杂深度卷积神经网络进行高效训练在计算上要求很高,并且需要并行计算资源。在本文中,我们提出了两个参数化性能模型,用于估计在英特尔众核架构上训练卷积神经网络的执行时间。对于第一个性能模型,我们极少使用测量技术来估计参数值,而在第二个模型中我们基于测量估计了更多参数。我们在英特尔 Xeon Phi 上训练三种不同卷积神经网络架构的背景下评估了性能模型的预测精度。第一个模型的平均性能预测精度约为 15%,第二个模型约为 11%。

关键词

引用

@article{arxiv.1906.01992,
  title  = {Performance Modelling of Deep Learning on Intel Many Integrated Core Architectures},
  author = {Andre Viebke and Sabri Pllana and Suejb Memeti and Joanna Kolodziej},
  journal= {arXiv preprint arXiv:1906.01992},
  year   = {2019}
}

备注

Preprint, HPCS. arXiv admin note: substantial text overlap with arXiv:1702.07908