中文

一种基于 $D^2$-采样的 $k$-means 及其他聚类问题的简单 PTAS

数据结构与算法 2012-01-23 v1

摘要

给定点集 PRdP \subset \mathbb{R}^dkk-means 聚类问题旨在寻找一组 kk 个{\em 中心} C={c1,...,ck},ciRd,C = \{c_1,...,c_k\}, c_i \in \mathbb{R}^d, 使得目标函数 xPd(x,C)2\sum_{x \in P} d(x,C)^2 最小化,其中 d(x,C)d(x,C) 表示 xxCC 中最近中心之间的距离。这是聚类研究中最著名的目标函数之一。D2D^2-采样 \cite{ArthurV07} 是一种从点集中选择点的简单非均匀采样技术。其工作原理如下:给定点集 PRdP \subseteq \mathbb{R}^d,第一个点从 PP 中均匀随机选择。随后,从 PP 中选择下一个样本点的概率与该点到此前已采样最近点距离的平方成正比。研究表明,D2D^2-采样在 kk-means 聚类问题中具有优良性质。Arthur 和 Vassilvitskii \cite{ArthurV07} 证明,使用 D2D^2-采样从 PP 中选择 kk 个点作为中心,在期望意义上可提供 O(logk)O(\log{k}) 近似。Ailon 等人 \cite{AJMonteleoni09} 和 Aggarwal 等人 \cite{AggarwalDK09} 扩展了 \cite{ArthurV07} 的结果,表明使用 D2D^2-采样选择 O(k)O(k) 个点作为中心,能以高概率为 kk-means 目标函数提供 O(1)O(1) 近似。在本文中,我们通过提出一种核心的 D2D^2-采样简单随机化 (1+ϵ)(1 + \epsilon)-近似算法,进一步展示了 D2D^2-采样的强大能力。

关键词

引用

@article{arxiv.1201.4206,
  title  = {A simple D^2-sampling based PTAS for k-means and other Clustering Problems},
  author = {Ragesh Jaiswal and Amit Kumar and Sandeep Sen},
  journal= {arXiv preprint arXiv:1201.4206},
  year   = {2012}
}