k-means聚类的自由度与模型选择
机器学习
2020-02-24 v4 机器学习
摘要
本文研究了k-means聚类中的模型自由度。Stein引理的一个推广为k-means模型中的有效自由度提供了一个表达式。在实践中近似该自由度需要对这一表达式进行简化,然而实证研究表明我们提出的方法是恰当的。通过利用贝叶斯信息准则进行模型选择,证明了这一新的k-means自由度公式的实际相关性。该方法在模拟数据以及来自不同应用领域的大量公开基准数据集上的实验验证了其可靠性。与现有流行技术的比较表明,该方法在选取高质量聚类解方面极具竞争力。实现所提方法的代码以R包的形式可从 https://github.com/DavidHofmeyr/edfkmeans 获取。
引用
@article{arxiv.1806.02034,
title = {Degrees of Freedom and Model Selection for k-means Clustering},
author = {David P. Hofmeyr},
journal= {arXiv preprint arXiv:1806.02034},
year = {2020}
}