中文

近似最优与准确聚类的半监督算法

数据结构与算法 2018-11-07 v2

摘要

我们研究半监督设定下的 kk-means 聚类。给定一个预言机,可返回两个给定点是否属于某个固定最优聚类中的同一簇,我们探究如下问题:需要多少次预言机查询,才能高效恢复一个以至少 (1δ)(1 - \delta) 的概率同时具有不超过 (1+ϵ)(1 + \epsilon) 倍最优代价且准确率至少 (1ϵ)(1 - \epsilon) 的聚类?我们展示了如何在 nn 个点上以 O((k2logn)m(Q,ϵ4,δ/(klogn)))O{((k^2 \log n) \cdot m{(Q, \epsilon^4, \delta / (k\log n))})} 次预言机查询实现这样的聚类,其中在监督设定下用 m(Q,ϵ,δ)m(Q, \epsilon',\delta') 个标注样本可以 ϵ\epsilon' 误差和失败概率 δ\delta' 学习出 kk 个簇,且 QQ 为候选簇中心集合。我们表明 m(Q,ϵ,δ)m(Q, \epsilon', \delta') 在欧几里得空间与有限度量空间中的 kk-means 实例上均较小。我们进一步表明,对于欧几里得 kk-means 实例,我们可以避免查询复杂度对 nn 的依赖,代价是增加对 kk 的依赖:具体而言,我们给出一个稍复杂的算法,使用 O(k4/(ϵ2δ)+(k9/ϵ4)log(1/δ)+km(Rr,ϵ4/k,δ))O(k^4/(\epsilon^2 \delta) + (k^{9}/\epsilon^4) \log(1/\delta) + k \cdot m(\mathbb{R}^r, \epsilon^4/k, \delta)) 次预言机查询。我们还表明,欧几里得 kk-means 中达到 (1ϵ)(1 - \epsilon)-准确率所需的查询数必须线性依赖于底层欧几里得空间的维数,而对于有限度量空间 kk-means,我们表明其至少须对数依赖于候选中心数。这表明我们的查询复杂度抓住了各参数间的正确依赖关系。

关键词

引用

@article{arxiv.1803.00926,
  title  = {Semi-Supervised Algorithms for Approximately Optimal and Accurate Clustering},
  author = {Buddhima Gamlath and Sangxia Huang and Ola Svensson},
  journal= {arXiv preprint arXiv:1803.00926},
  year   = {2018}
}