在最优分离条件下对有界协方差分布混合的聚类
机器学习
2023-12-20 v1 数据结构与算法
信息论
math.IT
统计理论
机器学习
统计理论
摘要
我们在细粒度分离假设下研究有界协方差分布混合的聚类问题。具体而言,给定来自 -分量混合分布 的样本,其中对于某个已知参数 满足每个 ,且每个 具有未知协方差 (对于某个未知 ),目标是在假设每对分量 和 之间存在 量级的成对均值分离的情况下对样本进行聚类。我们的贡献如下:对于近乎均匀混合的特例,我们给出了首个用于此聚类任务的多项式时间算法。先前的工作要么要求分离程度与最大聚类标准差(即 )成比例 [DKK+22b],要么要求额外的结构假设且均值分离程度与 呈大阶多项式关系 [BKK22]。对于一般权重混合,我们指出在我们的细粒度均值分离假设下,精确聚类在信息论上是不可能的。我们引入了聚类细化的概念——一个由不太小的子集组成的列表,满足类似的分离条件,并且可以合并为近似真实聚类的聚类——并证明可以高效地计算出样本的精确聚类细化。此外,在先前工作 [BKK22] 中“无大子聚类”条件的一个变体下,我们证明我们的算法输出的是精确聚类,而不仅仅是细化,即使对于一般权重混合也是如此。作为推论,我们获得了适用于良态高维对数凹分布混合的高效聚类算法。此外,我们的算法对 比例的对抗性异常值具有鲁棒性。
引用
@article{arxiv.2312.11769,
title = {Clustering Mixtures of Bounded Covariance Distributions Under Optimal Separation},
author = {Ilias Diakonikolas and Daniel M. Kane and Jasper C. H. Lee and Thanasis Pittas},
journal= {arXiv preprint arXiv:2312.11769},
year = {2023}
}