可解释 k-means:切勿贪心,种更大的树!
机器学习
2022-04-28 v2 数据结构与算法
摘要
我们为可解释 -means 聚类提供了一种新的双准则 竞争算法。可解释 -means 由 Dasgupta、Frost、Moshkovitz 和 Rashtchian(ICML 2020)近期提出。它由易于解释和理解的(阈值)决策树或图描述。可解释 -means 聚类的代价等于其各簇代价之和;每簇的代价等于该簇中点到簇中心的平方距离之和。最佳的非双准则可解释聚类算法为 竞争,且该界是紧的。我们的随机化双准则算法构造了一棵阈值决策树,将数据集划分为 个簇(其中 为算法参数)。该聚类的代价至多是最优无约束 -means 聚类代价的 倍。我们表明该界几乎是最优的。
引用
@article{arxiv.2111.03193,
title = {Explainable k-means. Don't be greedy, plant bigger trees!},
author = {Konstantin Makarychev and Liren Shan},
journal= {arXiv preprint arXiv:2111.03193},
year = {2022}
}
备注
29 pages, 4 figures