中文

聚类集成的同质性

机器学习 2016-02-09 v1 计算机视觉与模式识别

摘要

聚类集成生成的划分的期望和均值通常并不唯一。这一问题对统计推断和聚类稳定性提出了挑战。在本研究中,我们阐述了期望和均值唯一性的充分条件。所提出的条件表明,唯一均值既非例外也非普遍。为应对此问题,我们引入同质性(homogeneity)作为衡量划分样本中出现唯一均值可能性的指标。我们展示了同质性与聚类稳定性的关联。该结果指向共识聚类中聚类稳定性与多样性之间可能的冲突。为在实际环境中评估同质性,我们提出了一种计算同质性下界的高效方法。使用 k-means 算法的实证结果表明,对于真实世界数据,均值划分的唯一性并非例外。此外,对于高同质性的样本,可通过增加数据点数量或移除离群划分来强制实现唯一性。在更广义的背景下,本贡献可视为朝划分统计理论迈出的进一步一步。

关键词

引用

@article{arxiv.1602.02543,
  title  = {Homogeneity of Cluster Ensembles},
  author = {Brijnesh J. Jain},
  journal= {arXiv preprint arXiv:1602.02543},
  year   = {2016}
}