面向情感分类的降维:演化出最显著且可分离的特征
信息检索
2020-06-09 v1 机器学习
摘要
在情感分类中,海量的文本数据、其巨大的维度以及固有的噪声使得机器学习分类器极难提取高层且复杂的抽象特征。为使数据不那么稀疏且更具统计显著性,需要降维技术。但在现有降维技术中,分量数目需手动设定,导致最显著特征的丢失,从而降低分类器性能。我们先前的工作,即词项存在计数(TPC)与词项存在比率(TPR),已被证明是有效的技术,因其剔除了可分离性较弱的特征。然而,最显著且可分离的特征仍可能从初始特征集中被移除,尽管其在正、负标注文档间具有较高分布。为克服该问题,我们提出了一个包含两种降维技术的新框架,即情感词项存在计数(SentiTPC)与情感词项存在比率(SentiTPR)。这些技术通过考虑 SentiTPC 的词项存在差异与 SentiTPR 的分布区分比率来剔除特征。此外,这些方法还分析总分布信息。大量实验结果表明,所提框架大幅降低了特征维度,从而显著提升了分类性能。
引用
@article{arxiv.2006.04680,
title = {Dimensionality Reduction for Sentiment Classification: Evolving for the Most Prominent and Separable Features},
author = {Aftab Anjum and Mazharul Islam and Lin Wang},
journal= {arXiv preprint arXiv:2006.04680},
year = {2020}
}
备注
Pages 1-14