中文

基于混合伽马-负二项过程的无限作者主题模型

机器学习 2015-03-31 v1 信息检索 机器学习

摘要

将文本语料的侧信息(即作者、时间戳和情感标签)纳入传统文本挖掘模型,在信息检索、统计自然语言处理和机器学习领域引起了极大兴趣。这类工作的一个分支是所谓的作者主题模型(Author Topic Model, ATM),它将作者兴趣作为侧信息引入经典主题模型。然而,现有ATM需要预定义主题数量,这在许多实际场景中困难且不恰当。本文中,我们提出无限作者主题(Infinite Author Topic, IAT)模型来解决此问题。不同于在固定主题数上分配离散概率,我们使用随机过程从数据自身确定主题数量。具体而言,我们将伽马-负二项过程扩展到三个层次,以捕捉作者-文档-关键词的层次结构。此外,每个文档被分配一个混合伽马过程,用以解释多位作者对本文档的贡献。我们为IAT模型开发了一种高效的吉布斯采样推断算法,其每个条件分布均为闭式解。在多个真实数据集上的实验显示了我们的IAT模型能够同时学习隐藏主题、作者在这些主题上的兴趣以及主题数量。

关键词

引用

@article{arxiv.1503.08535,
  title  = {Infinite Author Topic Model based on Mixed Gamma-Negative Binomial Process},
  author = {Junyu Xuan and Jie Lu and Guangquan Zhang and Richard Yi Da Xu and Xiangfeng Luo},
  journal= {arXiv preprint arXiv:1503.08535},
  year   = {2015}
}

备注

10 pages, 5 figures, submitted to KDD conference