中文

改进的离群值鲁棒 k-means 初始化

机器学习 2023-09-07 v1 计算几何 数据结构与算法

摘要

kk-means 是一种流行的聚类目标,尽管其本质非鲁棒且对离群值敏感。其流行的初始化方法 kk-means++ 采用 D2D^{2} 采样,并带有可证明的 O(logk)O(\log k) 近似保证 \cite{AV2007}。然而,在存在对抗性噪声或离群值时,D2D^{2} 采样更可能从远端离群值而非内点簇中选取中心,因此其相对于内点上 kk-means 解的近似保证不再成立。假设离群值占给定数据的恒定比例,我们提出 D2D^2 采样分布的一个简单变体,使其对离群值鲁棒。我们的算法运行时间为 O(ndk)O(ndk),输出 O(k)O(k) 个簇,丢弃略多于最优离群值数量的点,并带有可证明的 O(1)O(1) 近似保证。我们的算法也可修改为输出恰好 kk 个簇而非 O(k)O(k) 个簇,同时保持其关于 nndd 的线性运行时间。相较此前基于 LP 松弛与舍入 \cite{Charikar}、\cite{KrishnaswamyLS18} 及 \textit{鲁棒 kk-means++} \cite{DeshpandeKP20} 的鲁棒 kk-means 结果,这是一个改进。我们的经验结果表明,在先前工作所用的标准真实世界与合成数据集上,我们的算法优于 kk-means++~\cite{AV2007}、均匀随机初始化、用于 kk means 的贪心采样 \cite{tkmeanspp} 及鲁棒 kk-means++~\cite{DeshpandeKP20}。我们的方案易于适配 kk-means++ 的可扩展、更快的并行实现 \cite{Bahmani,BachemL017},并且在存在离群值时的 coreset 构造方面具有独立意义 \cite{feldman2007ptas,langberg2010universal,feldman2011unified}。

关键词

引用

@article{arxiv.2309.02710,
  title  = {Improved Outlier Robust Seeding for k-means},
  author = {Amit Deshpande and Rameshwar Pratap},
  journal= {arXiv preprint arXiv:2309.02710},
  year   = {2023}
}