中文

基于格的方法在聚类上超越平方和

机器学习 2022-01-10 v2 计算复杂性 数据结构与算法 统计理论 机器学习 统计理论

摘要

聚类是无监督学习中的基本原语,衍生出一类计算上具有挑战性的推断任务。在本文中,我们关注在未知(且可能退化的)协方差下 d 维高斯混合聚类的典型任务。近期工作(Ghosh 等人 '20;Mao, Wein '21;Davis, Diaz, Wang '21)已针对低次多项式方法类与平方和(SoS)层次结构建立了在下述高斯聚类实例中恢复某些隐藏结构的下界。先前许多类似推断任务的工作预示此类下界强烈暗示聚类存在固有的统计-计算鸿沟,即存在某一参数区间使得聚类任务在统计上可行但无多项式时间算法成功。我们所考虑聚类任务的一个特例等价于在否则随机的子空间中寻找一个植入的超立方体向量。我们表明,或许令人惊讶的是,这一特定聚类模型并不展现统计-计算鸿沟,即便上述低次与 SoS 下界在此情形下依然成立。为此,我们给出了一个基于 Lenstra–Lenstra–Lovasz 格基约化方法的多项式时间算法,其达到了 d+1 个样本的统计最优样本复杂度。该结果扩展了可由“脆弱”多项式时间算法“弥合”其猜想统计-计算鸿沟的问题类,凸显了噪声在统计-计算鸿沟出现中关键而微妙的作用。

关键词

引用

@article{arxiv.2112.03898,
  title  = {Lattice-Based Methods Surpass Sum-of-Squares in Clustering},
  author = {Ilias Zadik and Min Jae Song and Alexander S. Wein and Joan Bruna},
  journal= {arXiv preprint arXiv:2112.03898},
  year   = {2022}
}

备注

Added a new tight information-theoretic lower bound for label recovery