用于偏斜文本分类的基于聚类的符号表示
信息检索
2017-06-27 v1 计算与语言
摘要
本文处理了与不平衡文本语料库相关的问题,提出了一种将不平衡文本语料库转化为平衡语料库的方法。所提出的方法采用聚类算法进行转换。首先,为避免维度灾难,采用了一种基于词项类别相关性度量的有效表示方案,该方案将维度大幅降低至语料库中的类别数量。随后,将较大规模类别的样本分组为若干较小规模的子类,以使整个语料库达到平衡。然后,利用区间值特征为每个子类赋予单一的符号向量表示。这种符号表示不仅紧凑,还有助于减少空间需求以及分类时间。所提出的模型在基准数据集即 Reuters 21578 和 TDT2 上经实证证明了其优越性。此外,还将其与包括基于支持向量机的模型在内的其他几种现有当代模型进行了比较。比较分析表明,所提出的模型优于其他现有模型。
引用
@article{arxiv.1706.07912,
title = {Cluster Based Symbolic Representation for Skewed Text Categorization},
author = {Lavanya Narayana Raju and Mahamad Suhil and D S Guru and Harsha S Gowda},
journal= {arXiv preprint arXiv:1706.07912},
year = {2017}
}
备注
14 Pages, 15 Figures, 1 Table, Conference: RTIP2R