度量空间中聚类的一种数学理论
机器学习
2016-02-22 v1
摘要
聚类是数据分析中最基本的问题之一,已在文献中得到广泛研究。尽管已提出许多聚类算法,但为这些聚类算法的使用提供理论依据的聚类理论仍不尽如人意。特别是,一个根本性的挑战是解决以下问题:一组数据点中,什么是簇?在本文中,我们试图通过考虑一组带有距离度量(度量)的数据点来解决这个问题。我们首先基于距离度量提出了一种新的凝聚度量。利用该凝聚度量,我们将簇定义为一组自身凝聚的点。对于这样的定义,我们证明存在多种具有直观解释的等价陈述。然后我们考虑第二个问题:在这样的定义下,我们如何找到簇以及簇的良好划分?针对这个问题,我们提出了一种层次凝聚算法和一种划分算法。与标准的层次凝聚算法不同,我们的层次凝聚算法具有特定的停止准则,并以簇的划分停止。我们的划分算法,在本文中称为 K-sets 算法,似乎是一种新的迭代算法。与需要两步最小化的 Lloyd 迭代不同,我们的 K-sets 算法仅需一步最小化。我们论文最有趣的发现之一是距离度量与凝聚度量之间的对偶性结果。这种对偶性结果引出了用于对具有凝聚度量的数据点集进行聚类的对偶 K-sets 算法。对偶 K-sets 算法的收敛方式与经典核 K-means 算法的顺序版本相同。关键区别在于,凝聚度量不需要是半正定的。
引用
@article{arxiv.1509.07755,
title = {A Mathematical Theory for Clustering in Metric Spaces},
author = {Cheng-Shang Chang and Wanjiun Liao and Yu-Sheng Chen and Li-Heng Liou},
journal= {arXiv preprint arXiv:1509.07755},
year = {2016}
}