改进的离群值鲁棒 k-means 初始化
机器学习
2023-09-07 v1 计算几何
数据结构与算法
摘要
-means 是一种流行的聚类目标,尽管其本质非鲁棒且对离群值敏感。其流行的初始化方法 -means++ 采用 采样,并带有可证明的 近似保证 \cite{AV2007}。然而,在存在对抗性噪声或离群值时, 采样更可能从远端离群值而非内点簇中选取中心,因此其相对于内点上 -means 解的近似保证不再成立。假设离群值占给定数据的恒定比例,我们提出 采样分布的一个简单变体,使其对离群值鲁棒。我们的算法运行时间为 ,输出 个簇,丢弃略多于最优离群值数量的点,并带有可证明的 近似保证。我们的算法也可修改为输出恰好 个簇而非 个簇,同时保持其关于 和 的线性运行时间。相较此前基于 LP 松弛与舍入 \cite{Charikar}、\cite{KrishnaswamyLS18} 及 \textit{鲁棒 -means++} \cite{DeshpandeKP20} 的鲁棒 -means 结果,这是一个改进。我们的经验结果表明,在先前工作所用的标准真实世界与合成数据集上,我们的算法优于 -means++~\cite{AV2007}、均匀随机初始化、用于 means 的贪心采样 \cite{tkmeanspp} 及鲁棒 -means++~\cite{DeshpandeKP20}。我们的方案易于适配 -means++ 的可扩展、更快的并行实现 \cite{Bahmani,BachemL017},并且在存在离群值时的 coreset 构造方面具有独立意义 \cite{feldman2007ptas,langberg2010universal,feldman2011unified}。
引用
@article{arxiv.2309.02710,
title = {Improved Outlier Robust Seeding for k-means},
author = {Amit Deshpande and Rameshwar Pratap},
journal= {arXiv preprint arXiv:2309.02710},
year = {2023}
}