中文

利用同簇查询精确恢复受损聚类

机器学习 2020-11-02 v3 机器学习

摘要

我们在半监督主动聚类框架下研究聚类恢复问题。给定有限输入点集,以及一个揭示任意两点是否位于同一簇的预言机(oracle),我们的目标是以尽可能少的查询精确恢复所有簇。为此,我们将 Ashtiani 等人的球面 kk-means 聚类假设放宽,以允许具有间隔的任意椭球簇。这去除了聚类基于中心(即通过优化问题定义)的假设,并包含了球面簇经任意旋转、轴缩放与点删除组合单独变换的所有情形。我们证明,即便在此远更一般的设定下,仍可能仅以随输入点数对数增长的查询次数精确恢复潜在聚类。更确切地说,我们设计了一种算法,给定需划分为 kk 个簇的 nn 个点,使用 O(k3lnklnn)O(k^3 \ln k \ln n) 次预言机查询与 O~(kn+k3)\tilde{O}(kn + k^3) 时间以零误分类误差恢复聚类。O()O(\cdot) 记号隐藏了关于簇维度的指数依赖,我们证明该依赖是必要的,从而刻画了问题的查询复杂度。我们的算法简单、易于实现,且亦可使用低拉伸分隔器(low-stretch separators)——一类具有额外理论保证的椭球——来学习簇。在大型合成数据集上的实验证实我们可以精确且高效地重建聚类。

关键词

引用

@article{arxiv.2006.04675,
  title  = {Exact Recovery of Mangled Clusters with Same-Cluster Queries},
  author = {Marco Bressan and Nicolò Cesa-Bianchi and Silvio Lattanzi and Andrea Paudice},
  journal= {arXiv preprint arXiv:2006.04675},
  year   = {2020}
}

备注

To appear at NeurIPS 2020 (oral)