中文

面向层次凝聚聚类的公平算法

机器学习 2023-08-01 v4 机器学习

摘要

层次凝聚聚类(HAC)算法在现代数据科学中被广泛使用,旨在将数据集划分为簇的同时生成数据样本间的层次关系。HAC 算法被应用于诸多领域,如生物学、自然语言处理和推荐系统。因此,必须确保这些算法的公平性——即使数据集包含针对某些受保护群体的偏见,所生成的簇输出也不应歧视来自任一这些群体的样本。然而,近期聚类公平性的研究大多集中于基于中心的聚类算法,如 k-median 和 k-means 聚类。本文中,我们提出用于执行 HAC 的公平算法,其强制的公平性约束:1) 与所采用的距离连接准则无关,2) 可推广至 HAC 的任意自然公平性度量,3) 适用于多个受保护群体,4) 具有与原始 HAC 相竞争的运行时。通过在多个真实世界 UCI 数据集上的大量实验,我们表明所提算法相比原始 HAC 及其他最先进的公平聚类方法能找到更公平的聚类。

关键词

引用

@article{arxiv.2005.03197,
  title  = {Fair Algorithms for Hierarchical Agglomerative Clustering},
  author = {Anshuman Chhabra and Prasant Mohapatra},
  journal= {arXiv preprint arXiv:2005.03197},
  year   = {2023}
}

备注

Accepted ICMLA'22