中文

面向机器学习偏差的整体视角:桥接算法公平与不平衡学习

机器学习 2022-07-14 v1 计算机与社会

摘要

机器学习(ML)在影响社会中广泛群体的决策中正扮演日益重要的角色。ML 模型为刑事司法、银行信贷发放以及企业招聘实践提供决策依据。这提出了模型公平性的要求,即自动化决策应相对于数据中常欠表示的受保护特征(如性别、种族或年龄)保持公平。我们假定该欠表示问题与不平衡数据学习问题存在对应关联。此类类别不平衡常同时反映于类别与受保护特征中。例如,某一类(获信贷者)可能相对于另一类(未获信贷者)过度表示,且某一特定群体(女性)可能相对于另一群体(男性)欠表示。实现受保护群体算法公平的关键要素,是同时降低底层训练数据中的类别与受保护群体不平衡,从而提升模型准确率与公平性。我们通过展示两领域关键概念如何重叠与互补,论述了桥接不平衡学习与群体公平的重要性;并提出了一种新颖过采样算法 Fair Oversampling,可同时处理偏斜类别分布与受保护特征。我们的方法:(i)可作为标准 ML 算法的高效预处理算法,联合解决不平衡与群体公平;(ii)可与公平感知学习算法结合以提升其对不同类别不平衡水平的鲁棒性。此外,我们朝桥接公平与不平衡学习迈进一步,提出新指标 Fair Utility,将平衡准确率与公平性结合。

关键词

引用

@article{arxiv.2207.06084,
  title  = {Towards A Holistic View of Bias in Machine Learning: Bridging Algorithmic Fairness and Imbalanced Learning},
  author = {Damien Dablain and Bartosz Krawczyk and Nitesh Chawla},
  journal= {arXiv preprint arXiv:2207.06084},
  year   = {2022}
}