中文

扩展动态主题模型

机器学习 2016-02-22 v1

摘要

动态主题模型(DTMs)在发现主题并捕捉时间序列数据中主题的演化趋势方面非常有效。为了对DTMs进行后验推断,现有方法均为批量算法,在每次模型更新前扫描整个数据集,并基于平均场假设做出不精确的变分近似。由于缺乏更具可扩展性的推断算法,尽管有用,DTMs未能捕捉大规模主题动态。本文填补了这一研究空白,提出了一种使用吉布斯采样与随机梯度朗之万动力学(Stochastic Gradient Langevin Dynamics)的快速且可并行化推断算法,该算法不做任何无根据的假设。我们还提出了一种基于Metropolis-Hastings的O(1)O(1)采样器,用于每个词符的主题分配。在分布式环境中,我们的算法在采样期间需要的工作节点间通信极少(几乎是易并行),并可扩展至大规模应用。我们能够训练出据我们所知最大的动态主题模型,并在不到半小时内从260万文档中学习到1000个主题的动态,且我们的实证结果表明,我们的算法不仅比基线快几个数量级,而且实现了更低的困惑度。

关键词

引用

@article{arxiv.1602.06049,
  title  = {Scaling up Dynamic Topic Models},
  author = {Arnab Bhadury and Jianfei Chen and Jun Zhu and Shixia Liu},
  journal= {arXiv preprint arXiv:1602.06049},
  year   = {2016}
}

备注

10 pages, 8 figures, to appear in WWW 2016