一种用于分布式异构数据学习的块随机算法
机器学习
2019-03-05 v1 流体动力学
机器学习
摘要
大多数深度学习模型基于具有输入输出间多层的深度神经网络。定义这些层的参数使用随机值初始化,并从数据中“学习”,通常采用基于随机梯度下降的算法。这些算法依赖于数据在优化前被随机打乱。为有效推导有用的深度学习模型,随机梯度下降算法形式上要求的批处理前数据随机化,因跨处理器节点的数据通信开销,预计对于原位模型训练将昂贵得令人却步。我们表明,即使(i)批次由来自单一类别或特定流动区域的样本构成,且(ii)整体数据样本是异构的,若批次按每处理器定义并以随机顺序处理,随机梯度下降(SGD)算法仍能取得有用进展。我们提出块随机梯度下降,一种无需预打乱即可在分布式异构数据上工作的新算法。该算法实现了亿级规模模拟的原位学习。该算法的性能在一组基准分类模型上及使用类似于亿级模拟中将遇到数据模型构建湍流槽道流的亚格子大涡模拟(LES)模型中得到了展示。
引用
@article{arxiv.1903.00091,
title = {A block-random algorithm for learning on distributed, heterogeneous data},
author = {Prakash Mohan and Marc T. Henry de Frahan and Ryan King and Ray W. Grout},
journal= {arXiv preprint arXiv:1903.00091},
year = {2019}
}