中文

一种用于文档分类的 WL-SPPIM 语义模型

计算与语言 2017-06-07 v1 人工智能

摘要

在本文中,我们探索了基于 SPPIM 的文本分类方法,实验表明,在三个国际标准化文本数据集(即 20newsgroups、Reuters52 和 WebKB)上的文本分类任务中,SPPIM 方法等同于甚至优于 SGNS 方法。与 SGNS 相比,尽管 SPPMI 提供了更好的解,但在文本分类任务中未必优于 SGNS。基于我们的分析,SGNS 在分解过程中考虑了权重计算,因此在某些标准数据集上比 SPPIM 表现更好。受此启发,我们提出了一种基于 SPPIM 模型的 WL-SPPIM 语义模型,实验表明,与 LDA、SGNS 和 SPPIM 方法相比,WL-SPPIM 方法在文本分类任务中具有更好的分类效果和更高的可扩展性。

关键词

引用

@article{arxiv.1706.01758,
  title  = {A WL-SPPIM Semantic Model for Document Classification},
  author = {Ming Li and Peilun Xiao and Ju Zhang},
  journal= {arXiv preprint arXiv:1706.01758},
  year   = {2017}
}

备注

7pages, 5figures, Keywords: LDA, SPPIM, word embedding, low frequency, document classification