面向大数据场景的直线 k-均值聚类
计算几何
2019-11-26 v3 数据结构与算法
摘要
直线 k-中位问题的输入是 中 条直线组成的集合 ,目标是计算 中 个中心(点)的集合,使 中每条直线到其最近中心的距离平方和最小。这是 -中位问题的直接推广,后者的输入是一组 个点而非直线。我们提出了首个 PTAS,可在时间 内计算该问题的 -近似,其中任意常数近似误差 ,以及常数整数 。这是通过证明 中总存在一个大小为 的加权子集(称为 coreset),可近似 到任意给定 个点集合的距离平方和。利用传统的合并与归约技术,该 coreset 意味着:对于流式(可能为无限)直线集合,可在一次遍历中(例如云端)将结果分发到 台机器,所用内存、更新时间和通信量关于 近对数级,并且支持删除任意直线但使用线性空间。这些结果可推广到其他距离函数,如 -中位(距离和)或忽略距给定中心最远的 条直线以处理离群值。在 Amazon EC2 云上 10 台机器的实验结果表明该算法在实践中表现良好。我们还提供了所有算法与实验的开源代码。本论文是以下已被接收论文的扩展:“-Means Clustering of Lines for Big Data”,作者 Yair Marom 与 Dan Feldman,NeurIPS 2019 会议论文集,将于 2019 年 12 月发表。
引用
@article{arxiv.1903.06904,
title = {k-Means Clustering of Lines for Big Data},
author = {Yair Marom and Dan Feldman},
journal= {arXiv preprint arXiv:1903.06904},
year = {2019}
}