中文

基于扩散度量的层次聚类

机器学习 2016-10-31 v1

摘要

我们研究由[arXiv:1510.05043]引入的层次聚类的代价函数,其中层次结构被视为一等对象,而非从其向平面聚类的投影导出代价。该文献还证明,自顶向下算法返回的层次聚类的代价至多是最优层次聚类代价的O(αnlogn)O\left(\alpha_n \log n\right)倍,其中αn\alpha_n是所用最稀疏割子程序的近似比。因此,利用Arora-Rao-Vazirani提出的最著名的最稀疏割近似算法,该自顶向下算法返回的层次聚类代价至多是最优解代价的O(log3/2n)O\left(\log^{3/2} n\right)倍。我们改进了这一点,给出了该问题的O(logn)O(\log{n})-近似算法。我们的主要技术要素包括:该代价函数诱导的超度量之组合刻画、针对该类超度量导出整数线性规划(ILP)表述,以及通过利用在图划分背景下被广泛使用的球增长思想来迭代舍入该表述的LP松弛。我们还证明了我们的算法对于[arXiv:1510.05043]中亦研究的该代价函数之推广返回O(logn)O(\log{n})-近似层次聚类。实验表明,使用ILP表述及我们的舍入算法所发现的层次结构,其向平面聚类的投影通常优于基于标准连接性的算法。我们还给出了该问题的常数因子不可近似性结果。

关键词

引用

@article{arxiv.1610.09269,
  title  = {Hierarchical Clustering via Spreading Metrics},
  author = {Aurko Roy and Sebastian Pokutta},
  journal= {arXiv preprint arXiv:1610.09269},
  year   = {2016}
}

备注

Extended abstract in proceedings of NIPS 2016