中文

通过增强k近邻分类与k-medoids聚类混合的新颖文本分类

信息检索 2013-12-10 v1

摘要

用于文本分类的机器学习是文档编目、新闻过滤、文档导向和示例的基础。在文本挖掘领域,有效的特征选择对于使学习任务更加准确和高效至关重要。传统的惰性文本分类器k近邻(kNN)在计算训练集和测试集中所有对象之间的相似度时存在一个主要缺陷,从而导致算法计算复杂度的增加和主存的大量消耗。为了从数据挖掘从业者的角度减少这些缺点,本文提出了一种混合技术,使用了一种新颖的重构版kNN,称为增强kNN(AkNN)和k-medoids(kMdd)聚类。所提出的工作包括对初始训练集进行预处理,通过施加属性特征选择来降低高维性,还检测并排除初始训练集中的高飞样本,并重构一个紧缩的训练集。kMdd聚类算法为每个类别生成聚类中心(作为内部对象),并用质心重构紧缩的训练集。该技术与预先安排文本挖掘相似度度量的AkNN分类器相结合。最终,根据新训练集中每个对象对测试集中对象的附属关系,为其分配显著的权重和排名。在Reuters-21578(一个UCI基准文本挖掘数据集)上进行的实验,以及与传统的kNN分类器的比较表明,所提出的方法在聚类和分类方面都表现出卓越的性能。

关键词

引用

@article{arxiv.1312.2375,
  title  = {Novel text categorization by amalgamation of augmented k-nearest neighborhood classification and k-medoids clustering},
  author = {RamachandraRao Kurada and Dr. K Karteeka Pavan},
  journal= {arXiv preprint arXiv:1312.2375},
  year   = {2013}
}

备注

13 Pages