中文

嵌套中文餐厅过程主题模型的可扩展推断

机器学习 2017-02-24 v1 分布式、并行与集群计算 信息检索 机器学习

摘要

嵌套中文餐厅过程(nCRP)主题模型是从给定文本语料库中提取主题层次结构的强大非参数贝叶斯方法,其中层次结构由数据自动确定。层次潜狄利克雷分配(hLDA)是 nCRP 主题模型的一个流行实例。然而,hLDA 仅在小规模上得到评估,因为现有的折叠吉布斯采样和实例化权重变分推断算法要么不可扩展,要么以平均场假设牺牲推断质量。此外,数据结构(如动态增长的计数矩阵和树)的高效分布式实现具有挑战性。本文中,我们提出一种新颖的部分折叠吉布斯采样(PCGS)算法,它结合了折叠与实例化权重算法的优点,以实现良好的可扩展性和高模型质量。提出一种初始化策略以进一步提升模型质量。最后,我们通过向量化、预处理以及对并发数据结构和通信策略的精心设计,提出了 PCGS 的高效分布式实现。实证研究表明,我们的算法比先前 hLDA 的开源实现高效 111 倍,且模型质量相当甚至更优。我们的分布式实现能从包含 280 亿词元的 1.31 亿文档语料库中提取 1722 个主题,这比先前最大语料库大 4-5 个数量级,使用 50 台机器在 7 小时内完成。

关键词

引用

@article{arxiv.1702.07083,
  title  = {Scalable Inference for Nested Chinese Restaurant Process Topic Models},
  author = {Jianfei Chen and Jun Zhu and Jie Lu and Shixia Liu},
  journal= {arXiv preprint arXiv:1702.07083},
  year   = {2017}
}