中文

针对含缺失值聚类的核心集

数据结构与算法 2021-11-12 v3

摘要

我们提供了第一个用于聚类 Rd\mathbb{R}^d 中具有多个缺失值(坐标)的点的核心集。先前的内核集构造仅允许一个缺失坐标。该设定下的挑战在于,诸如 kk-Means 之类的目标函数仅在可用(非缺失)坐标集上评估,而该坐标集随点不同而变化。回顾一下,ϵ\epsilon-核心集是大型数据集的一个小型代理,通常是点的重加权子集,它对每个可能的中心集以 (1+ϵ)(1+\epsilon) 因子近似聚类目标。我们的 kk-Means 和 kk-Median 聚类核心集大小为 (jk)O(min(j,k))(ϵ1dlogn)2(jk)^{O(\min(j,k))} (\epsilon^{-1} d \log n)^2,其中 nn 为数据点数,dd 为维度,jj 为每个数据点的最大缺失坐标数。我们进一步设计了在近线性时间内构造这些核心集的算法,从而将最近针对含缺失值 kk-Means 的二次时间 PTAS [Eiben 等人,SODA 2021] 改进为近线性时间。我们在各种真实数据集上验证了我们的核心集构造,其基于重要性采样且易于实现。我们的核心集在核心集大小与精度之间表现出灵活的权衡,并且总体优于均匀采样基线。此外,它显著加速了用于含缺失值 kk-Means 的 Lloyd 式启发式算法。

关键词

引用

@article{arxiv.2106.16112,
  title  = {Coresets for Clustering with Missing Values},
  author = {Vladimir Braverman and Shaofeng H. -C. Jiang and Robert Krauthgamer and Xuan Wu},
  journal= {arXiv preprint arXiv:2106.16112},
  year   = {2021}
}