中文

用于揭示文本数据主题的深层一元语言混合模型

机器学习 2020-12-10 v2 机器学习

摘要

一元语言混合模型(Mixtures of Unigrams)是对文本数据进行聚类最简单且最有效的工具之一,因为它们假设与同一主题相关的文档具有相似的词项分布,这自然由多项分布(Multinomials)描述。当分类任务尤其具有挑战性时,例如当文档-词项矩阵为高维且极度稀疏时,更具复合性的表示可更好地揭示分组结构。在本工作中,我们通过在贝叶斯框架下允许具有更深潜在层的模型,开发了用于具有大量词项的极短文档无监督分类的一元语言混合模型的深层版本。深层一元语言混合模型的表现与另一些传统及最先进(state-of-the-art)方法进行了实证比较,即基于余弦距离的 kk-means、基于语义分析变换数据上欧氏距离的 kk-means、围绕中心点的划分(Partition Around Medoids)、基于语义变换数据的高斯混合模型、基于 Ward 方法与余弦相异度的层次聚类、潜在狄利克雷分配(Latent Dirichlet Allocation)、通过 EM 算法估计的一元语言混合模型、谱聚类(Spectral Clustering)以及亲和传播聚类(Affinity Propagation clustering)。性能依据正确分类率与调整兰德指数(Adjusted Rand Index)进行评估。模拟研究与真实数据分析证明,对此类数据进行深层聚类可大幅提高分类精度。

关键词

引用

@article{arxiv.1902.06615,
  title  = {Deep Mixtures of Unigrams for uncovering Topics in Textual Data},
  author = {Cinzia Viroli and Laura Anderlucci},
  journal= {arXiv preprint arXiv:1902.06615},
  year   = {2020}
}