中文

基于指数倾斜实现高效且具个体公平性的 k-均值聚类

机器学习 2024-06-25 v1 计算机与社会

摘要

在基于位置的资源分配场景中,期望每个个体与设施之间的距离大致相等,从而确保公平性。实现这种公平性的常用方法是采用个体公平聚类。在本文中,我们提出了一种新型算法——倾斜 k-均值 (tilted k-means, TKM),旨在实现聚类的个体公平性。我们将指数倾斜 (exponential tilting) 集成到均方误差 (SSE) 求和中,以构建称为倾斜 SSE 的新目标函数。我们证明,倾斜 SSE 可推广为 SSE,并采用坐标下降和一阶梯度方法进行优化。我们提出了一种新颖的公平性度量——每个簇内距离的方差,这有助于缓解现有公平性度量常导致的Matthew 效应。我们的理论分析表明,著名的 k-means++ 算法会产生 O(k log k) 的乘性误差,并且我们在温和条件下证明了 TKM 的收敛性。就公平性而言,我们证明 TKM 生成的方差随比例超参数的增大而减小。就效率而言,我们证明其时间复杂性随数据集规模呈线性增长。我们的实验表明,TKM 在有效性、公平性和效率方面均优于当前最先进的方法。

关键词

引用

@article{arxiv.2406.16557,
  title  = {Efficient k-means with Individual Fairness via Exponential Tilting},
  author = {Shengkun Zhu and Jinshan Zeng and Yuan Sun and Sheng Wang and Xiaodong Li and Zhiyong Peng},
  journal= {arXiv preprint arXiv:2406.16557},
  year   = {2024}
}