中文

聚类可解释性的代价

数据结构与算法 2023-04-20 v1

摘要

给定dd维空间中的点集,可解释聚类是指那些由轴对齐阈值切割的树所指定的聚类。Dasgupta等人(ICML 2020)提出了可解释性代价的问题:最佳可解释聚类的代价与最佳聚类代价的最坏情况比率。我们证明kk-中位数的可解释性代价至多为1+Hk11+H_{k-1};事实上,我们证明流行的随机阈值算法恰好具有这一可解释性代价,与已知的下界构造相匹配。我们通过构造实例补充了对该特定算法的紧分析,其中(使用任何算法的)可解释性代价至少为(1o(1))lnk(1-o(1)) \ln k,表明我们的结果在上至低阶项意义下是最佳可能的。我们还将kk-均值问题的可解释性代价从先前的O(klnk)O(k \ln k)改进到O(klnlnk)O(k \ln \ln k),显著缩小了与Ω(k)\Omega(k)下界的差距。最后,我们研究了寻找最佳可解释聚类的算法问题:在标准复杂性理论猜想下,我们证明可解释kk-中位数和kk-均值无法被近似到优于O(lnk)O(\ln k)。这基本解决了可解释kk-中位数的可近似性,并为kk-均值留下获得显著优于其可解释性代价的近似算法的有趣可能。

关键词

引用

@article{arxiv.2304.09743,
  title  = {The Price of Explainability for Clustering},
  author = {Anupam Gupta and Madhusudhan Reddy Pittu and Ola Svensson and Rachel Yuan},
  journal= {arXiv preprint arXiv:2304.09743},
  year   = {2023}
}