文档聚类的重抽样方法
无序系统与神经网络
2007-05-23 v1
摘要
我们比较了不同聚类算法在无监督文本分类任务中的性能。我们考虑了层次聚类算法、主方向分层划分方法,以及(首次)使用多辛聚类方法以及几种距离度量。对这些算法应用了从Reuters-21578文本分类测试数据库中提取的测试数据库。我们发现,直接应用不同聚类算法会得到相当相同的聚类质量的结果。为了获得聚类结果的显著改进,至关重要的是要减少所考虑文档表示中词典的大小。通过识别判别性词汇并从词典中过滤掉非判别性词汇,可获得聚类质量的显著改进。我们提出了两种基于重抽样方案的方法,用于无监督地选择判别性词汇。
引用
@article{arxiv.cond-mat/0109006,
title = {Resampling methods for document clustering},
author = {D. Volk and M. G. Stepanov},
journal= {arXiv preprint arXiv:cond-mat/0109006},
year = {2007}
}
备注
RevTeX, 9 pages, 2 figures