在PIII集群上以92c/MFlops/s进行超大规模神经网络训练
机器学习
2019-11-14 v1 分布式、并行与集群计算
性能
机器学习
摘要
具有数百万可调参数和类似数量训练样本的人工神经网络,是解决语音与人脸识别、大规模网络数据分类以及金融等领域困难的大规模模式识别问题的潜在方案。瓶颈在于神经网络训练涉及迭代梯度下降且计算极其密集。本文提出一种在Bunyip(一个基于Linux、由196个Pentium III处理器组成的集群)上进行超大规模神经网络(ULSNN)分布式训练的技术。为说明ULSNN训练,我们描述了一个实验:训练一个具有173万可调参数的神经网络,从包含900万训练模式的数据库中识别机器印刷日文汉字。训练平均性能为163.3 GFlops/s(单精度)。机器成本为$150,913,由此得到性价比为92.4c/MFlops/s(单精度)。作为比较,使用双精度和ATLAS DGEMM的训练产生70 MFlops/s的持续性能或 $2.16 / MFlop/s(双精度)。
引用
@article{arxiv.1911.05181,
title = {92c/MFlops/s, Ultra-Large-Scale Neural-Network Training on a PIII Cluster},
author = {Douglas Aberdeen and Jonathan Baxter and Robert Edwards},
journal= {arXiv preprint arXiv:1911.05181},
year = {2019}
}
备注
SC '00: Proceedings of the 2000 ACM/IEEE Conference on Supercomputing