中文

Ward 方法分析

数据结构与算法 2019-07-12 v1 计算几何 机器学习

摘要

我们研究用于层次 kk-means 问题的 Ward 方法。这一流行的贪心启发式基于\emph{完全连接}范式:从所有数据点作为单点簇开始,它依次合并两个簇以形成少一个簇的聚类。所选簇对用于在下一步中(局部)最小化聚类的 kk-means 代价。完全连接算法在层次聚类问题中非常流行,但其理论性质研究相对较少。对于欧氏 kk-center 问题,Ackermann 等人证明由完全连接计算的层次中的 kk-聚类具有 Θ(logk)\Theta(\log k) 的最坏情况近似比。若数据位于常数维 ddRd\mathbb{R}^d 中,保证提升至 O(1)\mathcal{O}(1),但 O\mathcal{O} 记号隐藏了对 dd 的线性依赖。用于 kk-median 或 kk-means 的完全连接此前未被分析。本文中,我们证明若最优 kk-聚类良好分离,则 Ward 方法就 kk-means 目标函数计算出 22-近似。若此外最优聚类还满足平衡条件,则 Ward 方法完全恢复最优解。这些结果在任意维度成立。我们以在 Rd\mathbb{R}^d 中数据集上若无分离保证则 Ω((3/2)d)\Omega((3/2)^d) 的下界,以及当保证分离不够强时的下界,辅以我们的正面结果。最后,我们证明 Ward 对一维数据集产生 O(1)\mathcal{O}(1)-近似聚类。

关键词

引用

@article{arxiv.1907.05094,
  title  = {Analysis of Ward's Method},
  author = {Anna Großwendt and Heiko Röglin and Melanie Schmidt},
  journal= {arXiv preprint arXiv:1907.05094},
  year   = {2019}
}

备注

appeared at SODA 2019