LightLDA:在适度计算集群上运行的大规模主题模型
机器学习
2014-12-05 v1 分布式、并行与集群计算
信息检索
机器学习
摘要
在构建大规模机器学习 (ML) 程序(如大型主题模型或深度神经网络)时,人们通常假设此类任务只能借助拥有数千节点的工业级集群来完成,而这对于大多数从业者或学术研究人员来说是可望而不可即的。我们在网页规模语料库的主题建模背景下考虑这一挑战,并表明仅需一个由 8 台机器组成的适度集群,我们就可以训练一个拥有 100 万个主题和 100 万词词汇量(总计 1 万亿参数)的主题模型,处理包含 2000 亿 token 的文档集合——这一规模即使在使用数千台机器时也尚未见报道。我们的主要贡献包括:1) 一种新的高效 O(1) Metropolis-Hastings 采样算法,其运行成本(令人惊讶地)与模型大小无关,且经验收敛速度比当前最先进的 Gibbs 采样器快近一个数量级;2) 一种感知结构的模型并行方案,利用主题模型内的依赖关系,产生一种节省机器内存和网络通信的采样策略;3) 一种用于模型存储的差分数据结构,对高频词和低频词使用不同的数据结构,使超大模型能够装入内存,同时保持高推理速度;4) 一种有界异步数据并行方案,允许通过参数服务器高效分布式处理海量数据。我们的分布策略是 Petuum 框架 underlying 的通用分布式 ML 模型与数据并行编程模型的一个实例,并在 Petuum 开源系统之上实现。我们提供了实验证据,表明这一进展使得在小型集群上运行超大模型成为可能,同时与替代方案相比,仍能随着集群规模的增加享受成比例的时间成本降低。
引用
@article{arxiv.1412.1576,
title = {LightLDA: Big Topic Models on Modest Compute Clusters},
author = {Jinhui Yuan and Fei Gao and Qirong Ho and Wei Dai and Jinliang Wei and Xun Zheng and Eric P. Xing and Tie-Yan Liu and Wei-Ying Ma},
journal= {arXiv preprint arXiv:1412.1576},
year = {2014}
}