中文

分割与否:分类中差别对待的影响

机器学习 2022-04-15 v4 计算机与社会 信息论 math.IT 机器学习

摘要

当机器学习模型基于敏感属性(例如年龄、性别)对个体给出不同决策时,就会发生差别对待。在预测准确性至关重要的领域中,拟合表现出差别对待的模型可能是可接受的。为了评估差别对待的影响,我们比较了分割分类器(即对每个群体分别训练和部署的分类器)与群体盲分类器(即不使用敏感属性的分类器)的性能。我们引入了分割收益来量化通过分割分类器所带来的性能提升。直接从定义计算分割收益可能是难以处理的,因为它涉及在无穷维函数空间上求解优化问题。在不同的性能度量下,我们(i)证明了分割收益的等价表达式,可通过求解小规模凸规划高效计算;(ii)给出了分割收益的精确上下界,揭示了群体盲分类器总是会与分割分类器存在非平凡性能差距的精确条件。在有限样本情形下,分割未必有益,我们提供了数据依赖的界来理解这一效应。最后,我们通过合成与真实世界数据集上的数值实验验证了我们的理论结果。

关键词

引用

@article{arxiv.2002.04788,
  title  = {To Split or Not to Split: The Impact of Disparate Treatment in Classification},
  author = {Hao Wang and Hsiang Hsu and Mario Diaz and Flavio P. Calmon},
  journal= {arXiv preprint arXiv:2002.04788},
  year   = {2022}
}