针对含缺失值聚类的核心集
数据结构与算法
2021-11-12 v3
摘要
我们提供了第一个用于聚类 中具有多个缺失值(坐标)的点的核心集。先前的内核集构造仅允许一个缺失坐标。该设定下的挑战在于,诸如 -Means 之类的目标函数仅在可用(非缺失)坐标集上评估,而该坐标集随点不同而变化。回顾一下,-核心集是大型数据集的一个小型代理,通常是点的重加权子集,它对每个可能的中心集以 因子近似聚类目标。我们的 -Means 和 -Median 聚类核心集大小为 ,其中 为数据点数, 为维度, 为每个数据点的最大缺失坐标数。我们进一步设计了在近线性时间内构造这些核心集的算法,从而将最近针对含缺失值 -Means 的二次时间 PTAS [Eiben 等人,SODA 2021] 改进为近线性时间。我们在各种真实数据集上验证了我们的核心集构造,其基于重要性采样且易于实现。我们的核心集在核心集大小与精度之间表现出灵活的权衡,并且总体优于均匀采样基线。此外,它显著加速了用于含缺失值 -Means 的 Lloyd 式启发式算法。
引用
@article{arxiv.2106.16112,
title = {Coresets for Clustering with Missing Values},
author = {Vladimir Braverman and Shaofeng H. -C. Jiang and Robert Krauthgamer and Xuan Wu},
journal= {arXiv preprint arXiv:2106.16112},
year = {2021}
}