中文

一种用于可分离主题发现的新锚词选择方法

信息检索 2019-05-16 v1 计算与语言 机器学习 机器学习

摘要

可分离非负矩阵分解(SNMF)是主题建模的一种重要方法,其中“可分离”假设每个主题至少包含一个锚词,锚词定义为仅在该主题上具有非零概率的词。SNMF通过两步来揭示主题:锚词选择和主题恢复,其关注词共现模式。锚词的质量强烈影响所提取主题的质量。现有的锚词选择算法是在高维词共现空间中贪心地寻找近似凸包。在本工作中,我们提出一种新的锚词选择方法,将词共现概率与词相似度相关联,并假设在语义上差异最大的词是锚词的潜在候选。因此,若一词对的相似度很低,则这两个词极有可能是锚词。根据文本语料的统计信息,我们可以得到所有词对的相似度。我们构建词相似度图,其中节点对应词,边上的权重表示词对相似度。依此,我们设计了一种贪心方法,在图中寻找给定大小的最小边权锚团用于锚词选择。在真实语料上的大量实验证明了所提锚词选择方法的有效性,其在揭示的主题质量上优于常见的基于凸包的方法。同时,我们的方法比典型的基于SNMF的方法快得多。

关键词

引用

@article{arxiv.1905.06109,
  title  = {A New Anchor Word Selection Method for the Separable Topic Discovery},
  author = {Kun He and Wu Wang and Xiaosen Wang and John E. Hopcroft},
  journal= {arXiv preprint arXiv:1905.06109},
  year   = {2019}
}

备注

18 pages, 4 figures