中文

聚类硬分配与软分配方法的信息论分析

机器学习 2013-02-08 v1 机器学习

摘要

分配方法是许多无监督学习和聚类算法的核心,尤其是著名的 K-means 和期望最大化 (EM) 算法。在本文中,我们研究了多种不同的分配方法,包括 K-means 使用的“硬”分配和 EM 使用的“软”分配。虽然已知 K-means 最小化数据失真且 EM 最大化似然,但关于这两种算法行为之间的系统性差异知之甚少。在此,我们通过信息论分析阐明这些差异。我们结果的核心是对期望失真的简单分解,表明 K-means(及其从 unlabeled 样本数据推断一般参数密度的扩展)必须在分配给每个聚类的数据相似性与数据在聚类间的平衡性之间隐式地管理权衡。数据平衡程度由硬分配定义的划分的熵来衡量。除了让我们预测和验证 K-means 与 EM 在特定示例上的系统性差异外,该分解还使我们能够给出一个相当普遍的论证,表明 K-means 将始终找到比 EM“重叠”更少的密度。我们还研究了第三种自然的分配方法,称为后验分配,其在精神上接近 EM 的软分配,但导致了一种截然不同的算法。

关键词

引用

@article{arxiv.1302.1552,
  title  = {An Information-Theoretic Analysis of Hard and Soft Assignment Methods for Clustering},
  author = {Michael Kearns and Yishay Mansour and Andrew Y. Ng},
  journal= {arXiv preprint arXiv:1302.1552},
  year   = {2013}
}

备注

Appears in Proceedings of the Thirteenth Conference on Uncertainty in Artificial Intelligence (UAI1997)