均匀采样对含离群点基于中心聚类的有效性
数据结构与算法
2020-05-04 v3 机器学习
摘要
聚类在计算机科学中有诸多重要应用,但真实世界数据集常含离群点。此外,离群点的存在会使聚类问题更具挑战性。为降低复杂度,过去数年提出了多种采样方法。即从输入中选取小样本(均匀或非均匀)并在样本上运行已有近似算法。相较于已有非均匀采样方法,均匀采样方法有若干显著优势,例如仅需一遍读取数据且易于实践实现。因此,均匀采样对含离群点聚类的有效性是一个在理论与实践中均值得研究的自然且基础的问题。本文提出一个新的统一框架,用于分析均匀采样对三个代表性含离群点基于中心聚类问题的有效性:-center/median/means 含离群点聚类。我们引入“显著性”准则,并证明均匀采样的性能取决于给定实例的显著程度。特别地,我们证明样本大小可独立于比例 与维数。更重要的是,据我们所知,我们的方法是首个允许对这三个含离群点基于中心聚类问题精确丢弃 个离群点的均匀采样方法。本文结果也可视为先前普通聚类问题(无离群点)亚线性时间算法的扩展。实验表明,均匀采样方法可取得与其他已有方法相当的聚类结果,但大幅降低运行时间。
引用
@article{arxiv.1905.10143,
title = {The Effectiveness of Uniform Sampling for Center-Based Clustering with Outliers},
author = {Hu Ding and Jiawei Huang and Haikuo Yu},
journal= {arXiv preprint arXiv:1905.10143},
year = {2020}
}