基于 N-gram 的低维表示用于文档分类
计算与语言
2015-04-13 v2
摘要
词袋 (BOW) 模型是文档分类的常用方法,其中单词被用作训练分类器的特征。这通常涉及大量的特征。一些技术,如潜在语义分析 (LSA) 或潜在狄利克雷分配 (LDA),旨在以最小的语义信息损失将文档总结为低维表示。然而,由于仅考虑单词,某些语义信息总是会丢失。相反,我们旨在利用来自 n-gram 的信息来克服这一限制,同时保持在低维空间中。许多方法,如 Skip-gram 模型,能够非常快速地提供良好的词向量表示。我们建议对这些表示进行平均,以获得 n-gram 的表示。因此,所有 n-gram 都嵌入到同一个语义空间中。随后可以通过 K-means 聚类将它们分组为语义概念。特征数量因此大幅减少,文档可以表示为语义概念的袋。我们表明,该模型在情感分类任务上优于 LSA 和 LDA,并且以远少于传统 BOW 模型的特征数量取得了相似的结果。
引用
@article{arxiv.1412.6277,
title = {N-gram-Based Low-Dimensional Representation for Document Classification},
author = {Rémi Lebret and Ronan Collobert},
journal= {arXiv preprint arXiv:1412.6277},
year = {2015}
}
备注
Accepted as a workshop contribution at ICLR 2015