中文

ZenLDA:一种分布式数据并行平台上高效可扩展的主题模型训练系统

分布式、并行与集群计算 2015-11-23 v1

摘要

本文介绍了我们近期的工作 zenLDA,一个高效且可扩展的折叠吉布斯采样系统,用于潜在狄利克雷分配训练;由于多达数十亿文档的海量采样数据与多达数万亿参数的巨大模型规模,该任务被认为具有挑战性,因为它需要数据并行与模型并行兼备。zenLDA 结合了算法级改进与系统级优化。它首先提出一种新颖的 CGS 算法,在时间复杂度、模型精度与并行化灵活性之间取得平衡。zenLDA 中的输入语料库被表示为有向图,模型参数被标注为相应的顶点属性。分布式训练通过对图进行划分来实现并行化:每次迭代首先并行地对所有分区应用 CGS 步骤,随后相互同步计算出的模型。通过这种方式,数据并行与模型并行均通过转换为图并行得以实现。我们重新审视了系统效率与模型精度之间的权衡,并提出了诸如未同步模型、稀疏模型初始化和“已收敛”词元排除等近似方法。zenLDA 构建于 Spark 中的 GraphX 之上,后者提供分布式数据抽象(RDD)和富有表现力的 API,以简化编程工作并同时隐藏系统复杂性。这使我们能够通过少量代码改动实现其他 CGS 算法。为了更好地适配分布式数据并行框架并达到与现有系统相当的性能,我们还提出了若干系统级优化以突破性能极限。zenLDA 在网页规模语料库上进行了评估,结果表明 zenLDA 比我们实现的其他 CGS 算法性能大幅提升,同时获得了更好的模型精度。

关键词

引用

@article{arxiv.1511.00440,
  title  = {ZenLDA: An Efficient and Scalable Topic Model Training System on Distributed Data-Parallel Platform},
  author = {Bo Zhao and Hucheng Zhou and Guoqiang Li and Yihua Huang},
  journal= {arXiv preprint arXiv:1511.00440},
  year   = {2015}
}

备注

11 pages, 10 figures. arXiv admin note: text overlap with arXiv:1412.4986 by other authors