大型主题模型的模型并行推理
分布式、并行与集群计算
2014-11-11 v1 机器学习
机器学习
摘要
在主题建模的现实世界工业应用中,通过学习超高维主题表示(即所谓的“大模型”)来捕捉巨大的概念空间,正成为继“大数据”热潮之后的下一个需求,特别是对于在线广告等细粒度下游任务,这些任务通常通过在数百万甚至数十亿输入特征上构建的基于回归的预测器来实现良好性能。传统的用于训练巨型主题模型的数据并行方法在利用并行能力方面效率相当低下,这是因为其严重依赖于集中式的“模型”镜像。大模型尺寸也对存储提出了另一项挑战,其中可用模型尺寸受限于节点中最小的 RAM。为解决这些问题,我们探索了另一种类型的并行性,即模型并行性,它使得能够并行训练大主题模型的不相交块。通过将数据并行性与模型并行性相结合,我们展示了分布式元素之间的依赖关系可以被无缝处理,不仅实现了更快的收敛,还具备了处理显著更大模型尺寸的能力。我们描述了一种用于 LDA 模型并行推理的架构,并提出了一种为其量身定制的坍缩 Gibbs 采样算法变体。实验结果表明,该系统能够在仅有非常有限计算资源和带宽的低端集群上,处理拥有前所未有的 2000 亿模型变量的主题建模。
引用
@article{arxiv.1411.2305,
title = {Model-Parallel Inference for Big Topic Models},
author = {Xun Zheng and Jin Kyu Kim and Qirong Ho and Eric P. Xing},
journal= {arXiv preprint arXiv:1411.2305},
year = {2014}
}