中文

文档聚类的重抽样方法

无序系统与神经网络 2007-05-23 v1

摘要

我们比较了不同聚类算法在无监督文本分类任务中的性能。我们考虑了层次聚类算法、主方向分层划分方法,以及(首次)使用多辛聚类方法以及几种距离度量。对这些算法应用了从Reuters-21578文本分类测试数据库中提取的测试数据库。我们发现,直接应用不同聚类算法会得到相当相同的聚类质量的结果。为了获得聚类结果的显著改进,至关重要的是要减少所考虑文档表示中词典的大小。通过识别判别性词汇并从词典中过滤掉非判别性词汇,可获得聚类质量的显著改进。我们提出了两种基于重抽样方案的方法,用于无监督地选择判别性词汇。

关键词

引用

@article{arxiv.cond-mat/0109006,
  title  = {Resampling methods for document clustering},
  author = {D. Volk and M. G. Stepanov},
  journal= {arXiv preprint arXiv:cond-mat/0109006},
  year   = {2007}
}

备注

RevTeX, 9 pages, 2 figures