一种用于文档分类的 WL-SPPIM 语义模型
计算与语言
2017-06-07 v1 人工智能
摘要
在本文中,我们探索了基于 SPPIM 的文本分类方法,实验表明,在三个国际标准化文本数据集(即 20newsgroups、Reuters52 和 WebKB)上的文本分类任务中,SPPIM 方法等同于甚至优于 SGNS 方法。与 SGNS 相比,尽管 SPPMI 提供了更好的解,但在文本分类任务中未必优于 SGNS。基于我们的分析,SGNS 在分解过程中考虑了权重计算,因此在某些标准数据集上比 SPPIM 表现更好。受此启发,我们提出了一种基于 SPPIM 模型的 WL-SPPIM 语义模型,实验表明,与 LDA、SGNS 和 SPPIM 方法相比,WL-SPPIM 方法在文本分类任务中具有更好的分类效果和更高的可扩展性。
引用
@article{arxiv.1706.01758,
title = {A WL-SPPIM Semantic Model for Document Classification},
author = {Ming Li and Peilun Xiao and Ju Zhang},
journal= {arXiv preprint arXiv:1706.01758},
year = {2017}
}
备注
7pages, 5figures, Keywords: LDA, SPPIM, word embedding, low frequency, document classification