中文

偶然与认知歧视:公平性干预的根本局限

机器学习 2024-04-17 v3 计算机与社会 信息论 math.IT 机器学习

摘要

机器学习(ML)模型可能因模型开发过程中的选择以及数据固有的偏差而在某些群体上表现不佳。我们将 ML 流程中的歧视来源分为两类:偶然歧视,其固有于数据分布中;以及认知歧视,其源于模型开发过程中的决策。我们通过确定在公平性约束下模型在完美知晓数据分布时的性能极限来量化偶然歧视。我们展示了如何应用 Blackwell 关于统计实验比较的结果来刻画偶然歧视。然后我们将认知歧视量化为施加公平性约束时模型准确率与偶然歧视所施加极限之间的差距。我们将该方法应用于基准测试现有公平性干预,并调查含缺失值数据中的公平性风险。我们的结果表明,最先进的公平性干预在标准(过度使用的)表格数据集上能有效消除认知歧视。然而,当数据具有缺失值时,在处理偶然歧视方面仍有显著改进空间。

关键词

引用

@article{arxiv.2301.11781,
  title  = {Aleatoric and Epistemic Discrimination: Fundamental Limits of Fairness Interventions},
  author = {Hao Wang and Luxi He and Rui Gao and Flavio P. Calmon},
  journal= {arXiv preprint arXiv:2301.11781},
  year   = {2024}
}