适配含离群点的k-means算法
数据结构与算法
2022-09-26 v2 机器学习
摘要
本文展示了如何将几种简单且经典的基于采样的k-means问题算法适配到含离群点的设定中。最近,Bhaskara等人(NeurIPS 2019)展示了如何将经典k-means++算法适配到含离群点的设定中。然而,他们的算法需要输出O(log(k)·z)个离群点(其中z为真实离群点数量)才能匹配k-means++的O(log k)-近似保证。在本文中,我们基于他们的思想,展示如何将几种序贯与分布式k-means算法适配到含离群点的设定中,且具有显著更强的理论保证:我们的算法输出(1+ε)z个离群点,同时对目标函数实现O(1/ε)-近似。在序贯情形下,我们通过适配Lattanzi和Sohler(ICML 2019)的近期算法实现这一点。在分布式设定中,我们适配了Guha等人(IEEE Trans. Know. and Data Engineering 2003)的一个简单算法以及流行的k-means∥(Bahmani等人,PVLDB 2012)。我们技术的一个理论应用是一个运行时间为\tilde{O}(nk^2/z)的算法,该算法在输出O(z)个离群点的同时对目标函数实现O(1)-近似,假设k≪z≪n。这在预言机模型下由该问题的匹配下界Ω(nk^2/z)作为补充。
引用
@article{arxiv.2007.01118,
title = {Adapting $k$-means algorithms for outliers},
author = {Christoph Grunau and Václav Rozhoň},
journal= {arXiv preprint arXiv:2007.01118},
year = {2022}
}