层次聚类的代价
数据结构与算法
2022-05-04 v1
摘要
层次聚类是理解数据集遗传性质的一种常用工具。这样的聚类实际上是一系列聚类组成的序列,从每个数据点各自成簇的平凡聚类开始,然后不断合并两个现有簇,直到所有点都在同一簇中。-聚类层次若其层次中每个 -聚类的代价至多是最优 -聚类代价的 倍,则称其达到近似因子 。我们研究的代价函数为任意簇的最大(离散)半径(-中心问题)和任意簇的最大直径(-直径问题)。一般而言,最优聚类并不构成层次,因此无法达到 的近似因子。我们将任意实例所能达到的最小近似因子称为层次代价。对于 -直径问题,我们将层次代价的的上界改进为 。此外,我们显著改进了 -中心和 -直径的下界,分别证明了其层次代价恰为 和 。
引用
@article{arxiv.2205.01417,
title = {The Price of Hierarchical Clustering},
author = {Anna Arutyunova and Heiko Röglin},
journal= {arXiv preprint arXiv:2205.01417},
year = {2022}
}
备注
32 pages, 8 figures