中文

面向大数据场景的直线 k-均值聚类

计算几何 2019-11-26 v3 数据结构与算法

摘要

直线 k-中位问题的输入是 Rd\mathbb{R}^dnn 条直线组成的集合 LL,目标是计算 Rd\mathbb{R}^dkk 个中心(点)的集合,使 LL 中每条直线到其最近中心的距离平方和最小。这是 kk-中位问题的直接推广,后者的输入是一组 nn 个点而非直线。我们提出了首个 PTAS,可在时间 O(nlogn)O(n \log n) 内计算该问题的 (1+ϵ)(1+\epsilon)-近似,其中任意常数近似误差 ϵ(0,1)\epsilon \in (0, 1),以及常数整数 k,d1k, d \geq 1。这是通过证明 LL 中总存在一个大小为 dkO(k)log(n)/ϵ2dk^{O(k)}\log (n)/\epsilon^2 的加权子集(称为 coreset),可近似 LL 到任意给定 kk 个点集合的距离平方和。利用传统的合并与归约技术,该 coreset 意味着:对于流式(可能为无限)直线集合,可在一次遍历中(例如云端)将结果分发到 MM 台机器,所用内存、更新时间和通信量关于 nn 近对数级,并且支持删除任意直线但使用线性空间。这些结果可推广到其他距离函数,如 kk-中位(距离和)或忽略距给定中心最远的 mm 条直线以处理离群值。在 Amazon EC2 云上 10 台机器的实验结果表明该算法在实践中表现良好。我们还提供了所有算法与实验的开源代码。本论文是以下已被接收论文的扩展:“kk-Means Clustering of Lines for Big Data”,作者 Yair Marom 与 Dan Feldman,NeurIPS 2019 会议论文集,将于 2019 年 12 月发表。

关键词

引用

@article{arxiv.1903.06904,
  title  = {k-Means Clustering of Lines for Big Data},
  author = {Yair Marom and Dan Feldman},
  journal= {arXiv preprint arXiv:1903.06904},
  year   = {2019}
}