利用同簇查询精确恢复受损聚类
机器学习
2020-11-02 v3 机器学习
摘要
我们在半监督主动聚类框架下研究聚类恢复问题。给定有限输入点集,以及一个揭示任意两点是否位于同一簇的预言机(oracle),我们的目标是以尽可能少的查询精确恢复所有簇。为此,我们将 Ashtiani 等人的球面 -means 聚类假设放宽,以允许具有间隔的任意椭球簇。这去除了聚类基于中心(即通过优化问题定义)的假设,并包含了球面簇经任意旋转、轴缩放与点删除组合单独变换的所有情形。我们证明,即便在此远更一般的设定下,仍可能仅以随输入点数对数增长的查询次数精确恢复潜在聚类。更确切地说,我们设计了一种算法,给定需划分为 个簇的 个点,使用 次预言机查询与 时间以零误分类误差恢复聚类。 记号隐藏了关于簇维度的指数依赖,我们证明该依赖是必要的,从而刻画了问题的查询复杂度。我们的算法简单、易于实现,且亦可使用低拉伸分隔器(low-stretch separators)——一类具有额外理论保证的椭球——来学习簇。在大型合成数据集上的实验证实我们可以精确且高效地重建聚类。
引用
@article{arxiv.2006.04675,
title = {Exact Recovery of Mangled Clusters with Same-Cluster Queries},
author = {Marco Bressan and Nicolò Cesa-Bianchi and Silvio Lattanzi and Andrea Paudice},
journal= {arXiv preprint arXiv:2006.04675},
year = {2020}
}
备注
To appear at NeurIPS 2020 (oral)