中文

关于 k-means 聚类的变体

计算几何 2015-12-10 v1 数据结构与算法

摘要

\textit{聚类问题} 常出现在数据挖掘、机器学习等领域中,以根据相似性(或不相似性)度量将对象集合分组为相似组。在聚类问题中,特别是 \textit{kk-means} 聚类受到了研究者的颇多关注。尽管 kk-means 是一个被充分研究的问题,其在平面上的状态仍是一个开放问题。具体而言,未知其在平面上是否容许 PTAS(多项式时间近似方案)。多项式时间内已知的最佳近似界是 9+\eps9+\eps。在本文中,我们考虑如下 kk-means 变体。给定 Rd\mathcal{R}^d 中的点集 CC 和一个实数 f>0f > 0,寻找 Rd\mathcal{R}^d 中的有限点集 FF,使得量 fF+pCminqFpq2f*|F|+\sum_{p\in C} \min_{q \in F} {||p-q||}^2 最小化。对于任意固定维度 dd,我们为此问题设计了一个局部搜索 PTAS。我们还给出了一个用于 kk-means 的“双准则”局部搜索算法,其使用 (1+\eps)k(1+\eps)k 个中心,并给出一种解,其代价至多是最优 kk-means 解代价的 (1+\eps)(1+\eps) 倍。该算法在任意固定维度下以多项式时间运行。本文的贡献有两方面。一方面,我们能够以优雅的方式处理距离的平方,从而产生近最优近似界。这引导我们更好地理解 kk-means 问题。另一方面,我们对局部搜索的分析也可能对其他几何问题有用。考虑到关于几何近似的局部搜索方法所知甚少,这一点很重要。

关键词

引用

@article{arxiv.1512.02985,
  title  = {On Variants of k-means Clustering},
  author = {Sayan Bandyapadhyay and Kasturi Varadarajan},
  journal= {arXiv preprint arXiv:1512.02985},
  year   = {2015}
}

备注

15 pages