可解释 k-中位数与 k-均值的近最优算法
数据结构与算法
2021-08-04 v2 机器学习
摘要
我们考虑由 Dasgupta、Frost、Moshkovitz 和 Rashtchian(ICML 2020)提出的可解释 -中位数与 -均值问题。在该问题中,我们的目标是找到一棵阈值决策树,将数据划分为 个簇,并最小化 -中位数或 -均值目标函数。所得聚类易于解释,因为阈值树的每个决策节点都基于单一特征将数据拆分为两组。我们针对该问题提出了一种新算法,其在 -中位数( 范数)下具有 的竞争比,在 -均值下具有 的竞争比。这相比 Dasgupta 等人(2020)先前 和 的保证有所改进。我们还提供了一种新算法,在 -中位数( 范数)下具有 的竞争比。我们的第一种算法是近最优的:Dasgupta 等人(2020)给出了 -中位数 的下界;在本工作中,我们证明了 -均值 的下界。我们还给出了 -中位数( 范数) 的下界。
引用
@article{arxiv.2107.00798,
title = {Near-optimal Algorithms for Explainable k-Medians and k-Means},
author = {Konstantin Makarychev and Liren Shan},
journal= {arXiv preprint arXiv:2107.00798},
year = {2021}
}
备注
29 pages, 4 figures, ICML 2021