中文

在最优分离条件下对有界协方差分布混合的聚类

机器学习 2023-12-20 v1 数据结构与算法 信息论 math.IT 统计理论 机器学习 统计理论

摘要

我们在细粒度分离假设下研究有界协方差分布混合的聚类问题。具体而言,给定来自 kk-分量混合分布 D=i=1kwiPiD = \sum_{i =1}^k w_i P_i 的样本,其中对于某个已知参数 α\alpha 满足每个 wiαw_i \ge \alpha,且每个 PiP_i 具有未知协方差 Σiσi2Id\Sigma_i \preceq \sigma^2_i \cdot I_d(对于某个未知 σi\sigma_i),目标是在假设每对分量 PiP_iPjP_j 之间存在 (σi+σj)/α(\sigma_i+\sigma_j)/\sqrt{\alpha} 量级的成对均值分离的情况下对样本进行聚类。我们的贡献如下:对于近乎均匀混合的特例,我们给出了首个用于此聚类任务的多项式时间算法。先前的工作要么要求分离程度与最大聚类标准差(即 maxiσi\max_i \sigma_i)成比例 [DKK+22b],要么要求额外的结构假设且均值分离程度与 1/α1/\alpha 呈大阶多项式关系 [BKK22]。对于一般权重混合,我们指出在我们的细粒度均值分离假设下,精确聚类在信息论上是不可能的。我们引入了聚类细化的概念——一个由不太小的子集组成的列表,满足类似的分离条件,并且可以合并为近似真实聚类的聚类——并证明可以高效地计算出样本的精确聚类细化。此外,在先前工作 [BKK22] 中“无大子聚类”条件的一个变体下,我们证明我们的算法输出的是精确聚类,而不仅仅是细化,即使对于一般权重混合也是如此。作为推论,我们获得了适用于良态高维对数凹分布混合的高效聚类算法。此外,我们的算法对 Ω(α)\Omega(\alpha) 比例的对抗性异常值具有鲁棒性。

关键词

引用

@article{arxiv.2312.11769,
  title  = {Clustering Mixtures of Bounded Covariance Distributions Under Optimal Separation},
  author = {Ilias Diakonikolas and Daniel M. Kane and Jasper C. H. Lee and Thanasis Pittas},
  journal= {arXiv preprint arXiv:2312.11769},
  year   = {2023}
}