中文

基于间隔的带预言机查询簇恢复研究

机器学习 2021-06-10 v1 机器学习

摘要

我们研究一个主动簇恢复问题:给定 nn 个点集合以及一个回答诸如“这两个点是否在同一个簇中?”之类查询的预言机,任务是以尽可能少的查询精确恢复所有簇。我们首先引入一个简单但通用的簇间间隔概念,它作为特例涵盖了先前工作所用的间隔、经典 SVM 间隔,以及基于中心的聚类中标准的稳定性概念。随后,在我们的间隔假设下,我们设计了在多种设置中仅使用 O(logn)O(\log n) 次查询即可精确恢复所有簇的算法。对于欧几里得情形 Rm\mathbb{R}^m,我们给出一种在多项式时间内恢复任意凸簇的算法,其查询数量比现有最优算法低 Θ(mm)\Theta(m^m) 倍。对于一般的伪度量空间(其中簇可能非凸或没有任何形状概念),我们给出一种达到 O(logn)O(\log n) 查询界的算法,并且作为空间填充数的函数被证明近乎最优。最后,对于由二元概念类实现的聚类,我们给出了可用 O(logn)O(\log n) 次查询恢复的 combinatorial 表征,并表明对于欧几里得空间中的许多概念类,该表征等价于我们的间隔条件。我们的结果揭示了簇间隔与主动簇可恢复性之间的深刻联系。

关键词

引用

@article{arxiv.2106.04913,
  title  = {On Margin-Based Cluster Recovery with Oracle Queries},
  author = {Marco Bressan and Nicolò Cesa-Bianchi and Silvio Lattanzi and Andrea Paudice},
  journal= {arXiv preprint arXiv:2106.04913},
  year   = {2021}
}