利用同簇查询的近似聚类
数据结构与算法
2017-10-05 v3
摘要
Ashtiani 等人提出了一种半监督主动聚类框架(SSAC),其中允许学习器向领域专家进行自适应查询。查询的形式为“给定的两点是否属于同一个最优聚类?”在许多聚类场景中,此类同簇查询是可行的。Ashtiani 等人展示了此类查询的威力,他们证明了 -means 聚类问题的任何实例在附加间隔假设下,如果允许进行 次同簇查询,则可以被高效求解。这很令人感兴趣,因为 -means 问题即使在有间隔假设的情况下也是 -hard 的。在本文中,我们将 Ashtiani 等人的工作扩展到近似设定,证明了少量此类同簇查询使得人们能够为 -means 问题获得多项式时间的 -近似算法,而无需对输入数据集作任何间隔假设。这同样令人感兴趣,因为对于固定常数 ,-means 问题在因子 内近似是 -hard 的。所使用的同簇查询数量为 ,与数据集大小 无关。我们的算法基于 -采样技术。我们还给出了同簇查询数量的条件性下界,证明了如果指数时间假设(ETH)成立,则任何此类高效查询算法都需要进行 次同簇查询。我们的算法可以扩展到预言机有故障的情况。关于 -means++ 播种算法,我们展示的另一个结果是,在 SSAC 框架内对 -means++ 播种算法进行微小修改,即可将其转换为常数因子近似算法,而非众所周知的 -近似算法。
引用
@article{arxiv.1704.01862,
title = {Approximate Clustering with Same-Cluster Queries},
author = {Nir Ailon and Anup Bhattacharya and Ragesh Jaiswal and Amit Kumar},
journal= {arXiv preprint arXiv:1704.01862},
year = {2017}
}
备注
Updated version has results for faulty queries