中文

面向短文本多类分类问题的词袋模型中低频词的词向量增强

计算与语言 2017-09-19 v1 机器学习

摘要

词袋模型是许多线性分类器学习器的标准文本表示。在许多问题领域中,线性分类器因其效率、鲁棒性和可解释性而优于更复杂的模型,且词袋文本表示能够捕获足够的信息供线性分类器做出高精度预测。然而,在词汇量大、训练语料库中词频方差大、类别多且文本极短(例如,单个句子或文档标题)的设置下,词袋表示变得极其稀疏,这可能降低分类器的精度。此类设置中的一个特殊问题是,短文本倾向于包含缺乏类条件证据的不频繁出现或罕见词。在本工作中,我们引入一种方法,通过用来自通用和特定领域Word Vector模型的相关词补充此类罕见词信息,来增强词袋模型。通过减少词袋模型中的稀疏性,我们的增强方法在多种文本分类问题中实现了优于多个基线分类器的改进分类性能。我们的方法也很高效,因为它在训练前或训练期间不需要更改线性分类器,因为词袋增强仅适用于被分类的文本。

关键词

引用

@article{arxiv.1709.05778,
  title  = {Word Vector Enrichment of Low Frequency Words in the Bag-of-Words Model for Short Text Multi-class Classification Problems},
  author = {Bradford Heap and Michael Bain and Wayne Wobcke and Alfred Krzywicki and Susanne Schmeidl},
  journal= {arXiv preprint arXiv:1709.05778},
  year   = {2017}
}

备注

8 pages