聚类可解释性的代价
数据结构与算法
2023-04-20 v1
摘要
给定维空间中的点集,可解释聚类是指那些由轴对齐阈值切割的树所指定的聚类。Dasgupta等人(ICML 2020)提出了可解释性代价的问题:最佳可解释聚类的代价与最佳聚类代价的最坏情况比率。我们证明-中位数的可解释性代价至多为;事实上,我们证明流行的随机阈值算法恰好具有这一可解释性代价,与已知的下界构造相匹配。我们通过构造实例补充了对该特定算法的紧分析,其中(使用任何算法的)可解释性代价至少为,表明我们的结果在上至低阶项意义下是最佳可能的。我们还将-均值问题的可解释性代价从先前的改进到,显著缩小了与下界的差距。最后,我们研究了寻找最佳可解释聚类的算法问题:在标准复杂性理论猜想下,我们证明可解释-中位数和-均值无法被近似到优于。这基本解决了可解释-中位数的可近似性,并为-均值留下获得显著优于其可解释性代价的近似算法的有趣可能。
引用
@article{arxiv.2304.09743,
title = {The Price of Explainability for Clustering},
author = {Anupam Gupta and Madhusudhan Reddy Pittu and Ola Svensson and Rachel Yuan},
journal= {arXiv preprint arXiv:2304.09743},
year = {2023}
}