一种替代 TF-IDF 与词袋模型的文本表示方法
信息检索
2013-01-30 v1 机器学习
机器学习
摘要
在文本挖掘、信息检索和机器学习中,文本文档通常通过稀疏词袋(sBoW)向量的变体(如 TF-IDF)来表示。尽管简单直观,sBoW 风格的表示因其固有的过度稀疏性而受到影响,并且无法捕捉词级别的同义和多义现象。特别是当标注数据有限(例如在文档分类中)或文本文档较短(例如电子邮件或摘要)时,许多特征在训练语料库中很少被观察到。这会导致过拟合和泛化准确率降低。在本文中,我们提出了稠密词项队列(dCoT),这是一种无监督算法,用于学习改进的 sBoW 文档特征。dCoT 通过在未标注语料库中移除并重建随机的词子集,显式地对缺失词进行建模。通过这种方法,dCoT 学习从共现的低频词中重建高频词,并将高维稀疏 sBoW 向量映射到低维稠密表示中。我们证明,特征移除可以被边缘化,并且重建过程可以以闭式解求解。我们在多个基准数据集上通过实验证明,dCoT 特征在多个文档分类任务中显著提高了分类准确率。
引用
@article{arxiv.1301.6770,
title = {An alternative text representation to TF-IDF and Bag-of-Words},
author = {Zhixiang and Xu and Minmin Chen and Kilian Q. Weinberger and Fei Sha},
journal= {arXiv preprint arXiv:1301.6770},
year = {2013}
}