中文

广义归约:以低成本实现任意层次聚类的公平与平衡

机器学习 2023-05-11 v2 数据结构与算法

摘要

聚类是现代统计分析流程的基本构建模块。近年来,公平聚类受到了机器学习界的广泛关注。继 Ahmadian 等人于 2020 年 NeurIPS 发表的结果之后,我们是最早研究层次聚类公平性问题的团队之一。我们使用 Dasgupta 代价函数评估我们的结果,该函数或许是层次聚类评估中最普遍的理论度量之一。我们的工作将此前针对代价的 O(n5/6polylog(n))O(n^{5/6}poly\log(n)) 公平近似大幅改进为对于任意常数 δ(0,1)\delta\in(0,1) 的近多对数 O(nδpolylog(n))O(n^\delta poly\log(n)) 公平近似。该结果建立了代价-公平性权衡,并比此前工作适用于更广泛的公平性约束。我们还展示了如何修改已有的层次聚类,以在层次结构的任意层级上保证公平性与簇平衡。

关键词

引用

@article{arxiv.2205.14198,
  title  = {Generalized Reductions: Making any Hierarchical Clustering Fair and Balanced with Low Cost},
  author = {Marina Knittel and Max Springer and John P. Dickerson and MohammadTaghi Hajiaghayi},
  journal= {arXiv preprint arXiv:2205.14198},
  year   = {2023}
}