中文

局部搜索为倍增度量中的 k-Means 产生 PTAS

数据结构与算法 2017-01-11 v2 人工智能 计算几何

摘要

几乎在科学的每个分支中都能遇到的最著名且普遍存在的聚类问题无疑是 kk-means:给定一组数据点和一个参数 kk,选取 kk 个中心并将数据点划分为围绕这些中心的 kk 个簇,使得点到其簇中心的距离平方和最小。通常这些数据点位于某个 d2d\geq 2Rd\mathbb{R}^d 中。kk-means 及其首批算法于 20 世纪 50 年代被提出。此后,数百篇论文研究了该问题并提出了许多算法。最常用的算法称为 Lloyd-Forgy,也被称作“the” kk-means 算法,其各种扩展在实践中常表现良好。然而,它们可能产生与最优解相比代价任意大的解。Kanungo 等人 [2004] 分析了一种简单局部搜索启发式方法,得到了欧几里得空间中 kk-means 的多项式时间算法,其近似比为任意固定 ϵ>0\epsilon>0 时的 9+ϵ9+\epsilon。寻找具有更好近似保证的算法一直是该领域最大的开放问题之一,特别是能否对固定维欧几里得空间获得真正的 PTAS。我们通过证明简单的局部搜索算法对任意固定 ddRd\mathbb{R}^d 中为 kk-means 提供 PTAS 解决了该问题。更确切地说,对任意误差参数 ϵ>0\epsilon>0,考虑每次最多交换 ρ=dO(d)ϵO(d/ϵ)\rho=d^{O(d)}\cdot{\epsilon}^{-O(d/\epsilon)} 个中心的局部搜索算法,能找到恰好使用 kk 个中心的解,其代价至多比最优解大 (1+ϵ)(1+\epsilon) 倍。最后,我们首次证明在倍增度量下,局部搜索为无容量限制设施选址问题以及具有非均匀开设代价的 kk-median 问题产生 PTAS。

关键词

引用

@article{arxiv.1603.08976,
  title  = {Local Search Yields a PTAS for k-Means in Doubling Metrics},
  author = {Zachary Friggstad and Mohsen Rezapour and Mohammad R. Salavatipour},
  journal= {arXiv preprint arXiv:1603.08976},
  year   = {2017}
}