近似最优与准确聚类的半监督算法
数据结构与算法
2018-11-07 v2
摘要
我们研究半监督设定下的 -means 聚类。给定一个预言机,可返回两个给定点是否属于某个固定最优聚类中的同一簇,我们探究如下问题:需要多少次预言机查询,才能高效恢复一个以至少 的概率同时具有不超过 倍最优代价且准确率至少 的聚类?我们展示了如何在 个点上以 次预言机查询实现这样的聚类,其中在监督设定下用 个标注样本可以 误差和失败概率 学习出 个簇,且 为候选簇中心集合。我们表明 在欧几里得空间与有限度量空间中的 -means 实例上均较小。我们进一步表明,对于欧几里得 -means 实例,我们可以避免查询复杂度对 的依赖,代价是增加对 的依赖:具体而言,我们给出一个稍复杂的算法,使用 次预言机查询。我们还表明,欧几里得 -means 中达到 -准确率所需的查询数必须线性依赖于底层欧几里得空间的维数,而对于有限度量空间 -means,我们表明其至少须对数依赖于候选中心数。这表明我们的查询复杂度抓住了各参数间的正确依赖关系。
引用
@article{arxiv.1803.00926,
title = {Semi-Supervised Algorithms for Approximately Optimal and Accurate Clustering},
author = {Buddhima Gamlath and Sangxia Huang and Ola Svensson},
journal= {arXiv preprint arXiv:1803.00926},
year = {2018}
}