中文

Clust-LDA:文本挖掘与作者群体推断的联合模型

信息检索 2018-10-08 v1 社会与信息网络 应用统计

摘要

社交媒体语料带来了独特的挑战与机遇,包括通常较短的文档长度以及丰富的元数据(如作者特征与关系)。这为系统分析海量用户提供了巨大潜力,从而为定向营销等产业策略提供启示。本文提出一种新颖且统计严谨的方法 clust-LDA,其将作者结构纳入主题建模,从而基于作者身份完成跨文档的主题推断任务,同时实现作者间群体的识别。我们开发了 clust-LDA 的推断过程,并在模拟数据上展示其性能,表明在作者表现出显著主题偏好时 clust-LDA 在主题识别任务上优于“ vanilla” LDA。我们还基于来自 Reddit 的真实社交媒体数据集展示了 clust-LDA 的实证性能。

关键词

引用

@article{arxiv.1810.02717,
  title  = {Clust-LDA: Joint Model for Text Mining and Author Group Inference},
  author = {Shaoyang Ning and Xi Qu and Victor Cai and Nathan Sanders},
  journal= {arXiv preprint arXiv:1810.02717},
  year   = {2018}
}