基于簇质量的聚类数目实验估计
信息检索
2015-03-12 v1
摘要
文本聚类是一种将给定文本文档集合划分为有意义簇的文本挖掘技术。它用于将大量文本文档组织成规整的形式。大多数聚类算法必须预先指定簇的数量,这是这些算法的一个缺陷。本文旨在通过实验展示如何基于簇质量确定簇的数量。由于划分式聚类算法非常适合于大型文档数据集的聚类,我们将分析限于一种划分式聚类算法。
引用
@article{arxiv.1503.03168,
title = {Experimental Estimation of Number of Clusters Based on Cluster Quality},
author = {G. Hannah Grace and Kalyani Desikan},
journal= {arXiv preprint arXiv:1503.03168},
year = {2015}
}
备注
12 pages, 9 figures