基于草图与层次相关聚类的层次聚类
数据结构与算法
2021-01-27 v1
摘要
近年来,层次聚类(HC)已通过优化的视角被加以考量。具体而言,已定义了两个最大化目标。Moseley 和 Wang 定义了 \emph{Revenue} 目标以处理由数据点上的加权图给出的相似性信息(不失一般性,权重为 ),而 Cohen-Addad 等人定义了 \emph{Dissimilarity} 目标以处理相异性信息。在本文中,我们证明了针对这两个目标的结构性引理,使得我们能够将任意 HC 树转换为具有常数个内部节点的树,同时在各目标上产生任意小的损失。尽管已知最佳近似分别为 0.585 和 0.667,但利用我们的引理,若并非所有权重都较小(即存在常数 使得小于 的权重比例至多为 ),我们可获得任意接近 1 的近似;此类实例涵盖许多基于度量的相似性实例,从而改进了先前的工作。最后,我们引入层次相关聚类(HCC)以处理同时包含相似性与相异性信息的实例。对于 HCC,我们提供了 0.4767 的近似,而对于互补相似性/相异性权重(类似于 相关聚类),我们再次给出了近乎最优的近似。
引用
@article{arxiv.2101.10639,
title = {Hierarchical Clustering via Sketches and Hierarchical Correlation Clustering},
author = {Danny Vainstein and Vaggos Chatziafratis and Gui Citovsky and Anand Rajagopalan and Mohammad Mahdian and Yossi Azar},
journal= {arXiv preprint arXiv:2101.10639},
year = {2021}
}