中文

层次聚类的代价

数据结构与算法 2022-05-04 v1

摘要

层次聚类是理解数据集遗传性质的一种常用工具。这样的聚类实际上是一系列聚类组成的序列,从每个数据点各自成簇的平凡聚类开始,然后不断合并两个现有簇,直到所有点都在同一簇中。kk-聚类层次若其层次中每个 kk-聚类的代价至多是最优 kk-聚类代价的 α\alpha 倍,则称其达到近似因子 α\alpha。我们研究的代价函数为任意簇的最大(离散)半径(kk-中心问题)和任意簇的最大直径(kk-直径问题)。一般而言,最优聚类并不构成层次,因此无法达到 11 的近似因子。我们将任意实例所能达到的最小近似因子称为层次代价。对于 kk-直径问题,我们将层次代价的的上界改进为 3+225.833+2\sqrt{2}\approx 5.83。此外,我们显著改进了 kk-中心和 kk-直径的下界,分别证明了其层次代价恰为 443+223+2\sqrt{2}

关键词

引用

@article{arxiv.2205.01417,
  title  = {The Price of Hierarchical Clustering},
  author = {Anna Arutyunova and Heiko Röglin},
  journal= {arXiv preprint arXiv:2205.01417},
  year   = {2022}
}

备注

32 pages, 8 figures