中文

通过模型与数据偏差交互理解欺诈检测中的不公平性

机器学习 2022-07-14 v1 计算机与社会 统计金融

摘要

近年来,机器学习算法已无处不在地应用于众多高风险决策场景中。机器学习算法从数据中学习模式的卓越能力也使其能吸纳其中嵌入的偏差。一个有偏的模型随后可能做出对某些社会群体造成不成比例损害的决策——例如限制他们获得金融服务。对此问题的认识催生了公平机器学习(Fair ML)领域,该领域专注于研究、衡量和缓解针对一组受保护群体(如种族或性别)的算法预测中的不公平性。然而,算法不公平性的根本原因仍不明确,研究者们分歧在于归咎于 ML 算法还是其训练数据。在这项工作中,我们主张算法不公平性源于模型与数据中偏差的交互,而非二者各自的孤立贡献。为此,我们提出了一个刻画数据偏差的分类法,并研究了一组关于盲公平 ML 算法在不同数据偏差设定下所展现的公平-准确性权衡的假设。在我们的真实世界开户欺诈用例中,我们发现每种设定都带来特定的权衡,影响期望值与方差上的公平性——后者常被忽视。此外,我们展示了算法在准确性和公平性方面的比较如何因影响数据的偏差不同而不同。最后,我们注意到在特定数据偏差条件下,简单的预处理干预可以成功平衡群体错误率,而同样的技术在更复杂设定中失效。

关键词

引用

@article{arxiv.2207.06273,
  title  = {Understanding Unfairness in Fraud Detection through Model and Data Bias Interactions},
  author = {José Pombal and André F. Cruz and João Bravo and Pedro Saleiro and Mário A. T. Figueiredo and Pedro Bizarro},
  journal= {arXiv preprint arXiv:2207.06273},
  year   = {2022}
}

备注

KDD'22 Workshop on Machine Learning in Finance