在 MapReduce 和流模型中求解 $k$-中心聚类(含离群点),精度几乎与顺序算法相当
分布式、并行与集群计算
2021-06-02 v6 数据结构与算法
摘要
基于中心的聚类是数据分析的基本原语,对大型数据集而言极具挑战性。本文关注流行的 -中心变体:给定度量空间中点的集合 和参数 ,需识别 中 个中心子集,使 中任意点到其最近中心的最大距离最小化。为处理含噪数据集而引入的更一般表述引入另一参数 ,并允许在计算到中心的最大距离时忽略 中最多 个点(离群点)。我们针对以上两种问题表述提出基于 coreset 的 2-轮 MapReduce 算法,以及针对含离群点情形的 1-遍流算法。对任意固定 ,算法所得解的近似比仅比已知最佳多项式时间顺序算法可达成者多出可加项 ,该结果大幅改进了现有最优水平。我们的算法相当简单,并适应由度量空间加倍维数 刻画的数据集内在复杂度。具体而言,分析表明对于重要的小(常数) 情形算法空间效率极高。这些理论结果辅以在多达逾十亿个点的真实与合成数据集上的实验,表明我们的算法相较现有最优水平产出更高质量解且具备优异可扩展性,并也适用于比现有实现快得多的顺序实现。
引用
@article{arxiv.1802.09205,
title = {Solving $k$-center Clustering (with Outliers) in MapReduce and Streaming, almost as Accurately as Sequentially},
author = {Matteo Ceccarello and Andrea Pietracaprina and Geppino Pucci},
journal= {arXiv preprint arXiv:1802.09205},
year = {2021}
}