中文

一种关联主题模型在《科学》期刊中的应用

应用统计 2009-09-29 v2

摘要

主题模型,如潜在狄利克雷分配(LDA),可作为文档集合及其他离散数据统计分析的有用工具。LDA模型假设每篇文档的词来自多个主题的混合,每个主题是词汇表上的一个分布。LDA的一个局限是无法对主题相关性建模,尽管例如一篇关于遗传学的文档更可能同时也关于疾病而非X射线天文学。这一局限源于使用狄利克雷分布来建模主题比例之间的变异性。在本文中,我们开发了关联主题模型(CTM),其中主题比例通过对数正态分布[J. Roy. Statist. Soc. Ser. B 44 (1982) 139--177]展现相关性。我们推导了一种快速变分推断算法,用于该模型中的近似后验推断,由于对数正态分布不与多项分布共轭,这使问题变得复杂。我们将CTM应用于1990年至1999年出版的《科学》期刊文章,该数据集包含5700万个词。CTM比LDA更好地拟合了数据,我们展示了其作为大型文档集合探索性工具的用途。

关键词

引用

@article{arxiv.0708.3601,
  title  = {A correlated topic model of Science},
  author = {David M. Blei and John D. Lafferty},
  journal= {arXiv preprint arXiv:0708.3601},
  year   = {2009}
}

备注

Published at http://dx.doi.org/10.1214/07-AOAS114 in the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)