中文

可解释 k-中位数与 k-均值的近最优算法

数据结构与算法 2021-08-04 v2 机器学习

摘要

我们考虑由 Dasgupta、Frost、Moshkovitz 和 Rashtchian(ICML 2020)提出的可解释 kk-中位数与 kk-均值问题。在该问题中,我们的目标是找到一棵阈值决策树,将数据划分为 kk 个簇,并最小化 kk-中位数或 kk-均值目标函数。所得聚类易于解释,因为阈值树的每个决策节点都基于单一特征将数据拆分为两组。我们针对该问题提出了一种新算法,其在 kk-中位数(1\ell_1 范数)下具有 O~(logk)\tilde O(\log k) 的竞争比,在 kk-均值下具有 O~(k)\tilde O(k) 的竞争比。这相比 Dasgupta 等人(2020)先前 O(k)O(k)O(k2)O(k^2) 的保证有所改进。我们还提供了一种新算法,在 kk-中位数(2\ell_2 范数)下具有 O(log3/2k)O(\log^{3/2} k) 的竞争比。我们的第一种算法是近最优的:Dasgupta 等人(2020)给出了 kk-中位数 Ω(logk)\Omega(\log k) 的下界;在本工作中,我们证明了 kk-均值 Ω~(k)\tilde\Omega(k) 的下界。我们还给出了 kk-中位数(2\ell_2 范数)Ω(logk)\Omega(\log k) 的下界。

关键词

引用

@article{arxiv.2107.00798,
  title  = {Near-optimal Algorithms for Explainable k-Medians and k-Means},
  author = {Konstantin Makarychev and Liren Shan},
  journal= {arXiv preprint arXiv:2107.00798},
  year   = {2021}
}

备注

29 pages, 4 figures, ICML 2021