中文

一种成对公平且保持社区的 k-中心聚类方法

机器学习 2020-07-16 v1 数据结构与算法 机器学习

摘要

聚类是机器学习中的基础问题,具有众多应用。随着机器学习作为自动化系统后端日益普及,公平性担忧浮现。当前多数公平性文献涉及监督学习(群体公平)中对受保护类的歧视。我们定义了一种不同的公平聚类概念:两点(或一点群社区)被分离的概率由它们成对距离(或社区直径)的增函数界定。我们刻画了数据点代表人、且因聚在一起而获益的情形。当某些点被确定性分离时(无论是任意地,还是如选区划分选举区中有人意图伤害他们)便产生不公平。对此,我们正式定义了聚类设定中两种新型公平性:成对公平与社区保持。为探究我们公平性目标的可行性,我们设计了一种扩展现有 kk-中心算法以满足这些公平约束的方法。对该方法的分析证明,在保持公平的同时可实现合理近似。实验中,我们将本方法与传统 kk-中心算法/启发式比较,并探究最优聚类与公平性间的权衡。

关键词

引用

@article{arxiv.2007.07384,
  title  = {A Pairwise Fair and Community-preserving Approach to k-Center Clustering},
  author = {Brian Brubach and Darshan Chakrabarti and John P. Dickerson and Samir Khuller and Aravind Srinivasan and Leonidas Tsepenekas},
  journal= {arXiv preprint arXiv:2007.07384},
  year   = {2020}
}