中文

随机模型对聚类相似性的影响

机器学习 2017-10-03 v2

摘要

聚类是无监督学习的中心方法。应用聚类后,最基本的分析是定量比较聚类结果。此类比较对于聚类方法的评估以及诸如共识聚类等其他任务至关重要。通常认为,为建立基线,聚类相似性应在随机聚类集成背景下评估。普遍假设的随机聚类集成是排列模型,其中聚类的数量和大小固定。然而,该假设在实践中不一定成立;例如,K-means聚类的多次运行返回具有固定聚类数但聚类大小分布变化很大的聚类。在此,我们推导了两种聚类相似性度量(Rand指数和互信息)在聚类数量和大小变化的两种随机聚类集成下的修正变体。此外,我们研究了在具有参考聚类的场景下一侧比较的影响。不同随机模型的影响使用合成示例、手写数字识别和基因表达数据加以说明。我们证明随机模型的选择会对相似聚类对的排序以及聚类方法相对于随机基线的评估产生急剧影响;因此,随机聚类模型的选择应谨慎论证。

关键词

引用

@article{arxiv.1701.06508,
  title  = {The Impact of Random Models on Clustering Similarity},
  author = {Alexander J Gates and Yong-Yeol Ahn},
  journal= {arXiv preprint arXiv:1701.06508},
  year   = {2017}
}

备注

28 pages, 5 figures