关于 k-means 聚类的变体
计算几何
2015-12-10 v1 数据结构与算法
摘要
\textit{聚类问题} 常出现在数据挖掘、机器学习等领域中,以根据相似性(或不相似性)度量将对象集合分组为相似组。在聚类问题中,特别是 \textit{-means} 聚类受到了研究者的颇多关注。尽管 -means 是一个被充分研究的问题,其在平面上的状态仍是一个开放问题。具体而言,未知其在平面上是否容许 PTAS(多项式时间近似方案)。多项式时间内已知的最佳近似界是 。在本文中,我们考虑如下 -means 变体。给定 中的点集 和一个实数 ,寻找 中的有限点集 ,使得量 最小化。对于任意固定维度 ,我们为此问题设计了一个局部搜索 PTAS。我们还给出了一个用于 -means 的“双准则”局部搜索算法,其使用 个中心,并给出一种解,其代价至多是最优 -means 解代价的 倍。该算法在任意固定维度下以多项式时间运行。本文的贡献有两方面。一方面,我们能够以优雅的方式处理距离的平方,从而产生近最优近似界。这引导我们更好地理解 -means 问题。另一方面,我们对局部搜索的分析也可能对其他几何问题有用。考虑到关于几何近似的局部搜索方法所知甚少,这一点很重要。
引用
@article{arxiv.1512.02985,
title = {On Variants of k-means Clustering},
author = {Sayan Bandyapadhyay and Kasturi Varadarajan},
journal= {arXiv preprint arXiv:1512.02985},
year = {2015}
}
备注
15 pages