中文

利用同簇查询的近似聚类

数据结构与算法 2017-10-05 v3

摘要

Ashtiani 等人提出了一种半监督主动聚类框架(SSAC),其中允许学习器向领域专家进行自适应查询。查询的形式为“给定的两点是否属于同一个最优聚类?”在许多聚类场景中,此类同簇查询是可行的。Ashtiani 等人展示了此类查询的威力,他们证明了 kk-means 聚类问题的任何实例在附加间隔假设下,如果允许进行 O(k2logk+klogn)O(k^2 \log{k} + k \log{n}) 次同簇查询,则可以被高效求解。这很令人感兴趣,因为 kk-means 问题即使在有间隔假设的情况下也是 NP\mathsf{NP}-hard 的。在本文中,我们将 Ashtiani 等人的工作扩展到近似设定,证明了少量此类同簇查询使得人们能够为 kk-means 问题获得多项式时间的 (1+ε)(1 + \varepsilon)-近似算法,而无需对输入数据集作任何间隔假设。这同样令人感兴趣,因为对于固定常数 0<c<10 < c < 1kk-means 问题在因子 (1+c)(1 + c) 内近似是 NP\mathsf{NP}-hard 的。所使用的同簇查询数量为 poly(k/ε)\textrm{poly}(k/\varepsilon),与数据集大小 nn 无关。我们的算法基于 D2D^2-采样技术。我们还给出了同簇查询数量的条件性下界,证明了如果指数时间假设(ETH)成立,则任何此类高效查询算法都需要进行 Ω(kpolylogk)\Omega \left(\frac{k}{\textrm{poly} \log k} \right) 次同簇查询。我们的算法可以扩展到预言机有故障的情况。关于 kk-means++ 播种算法,我们展示的另一个结果是,在 SSAC 框架内对 kk-means++ 播种算法进行微小修改,即可将其转换为常数因子近似算法,而非众所周知的 O(logk)O(\log{k})-近似算法。

关键词

引用

@article{arxiv.1704.01862,
  title  = {Approximate Clustering with Same-Cluster Queries},
  author = {Nir Ailon and Anup Bhattacharya and Ragesh Jaiswal and Amit Kumar},
  journal= {arXiv preprint arXiv:1704.01862},
  year   = {2017}
}

备注

Updated version has results for faulty queries