机器学习软件中的偏差:为何?如何?如何应对?
机器学习
2021-07-12 v3 软件工程
摘要
软件日益在刑事判决、信用卡审批、员工招聘等方面做出自主决策。其中一些决策表现出偏差,并对特定社会群体(例如由性别、种族、年龄、婚姻状况定义的群体)产生不利影响。许多先前的偏差缓解工作采取如下形式:以多种方式改变数据或学习器,然后查看其中是否有任何能改善公平性。或许更好的方法是假定偏差的根本原因,然后应用某种解决策略。本文假定偏差的根本原因是影响(a)所选数据以及(b)赋予这些样本的标签的先前决策。我们的 Fair-SMOTE 算法移除有偏标签;并重新平衡内部分布,使得基于敏感属性,样本在正负类中均等。测试表明,该方法在降低偏差方面与先前方法同样有效。此外,通过 Fair-SMOTE 生成的模型取得了比其他最先进公平性改进算法更高的性能(以召回率和 F1 衡量)。据我们所知,按所分析的学习器与数据集数量衡量,本研究是文献中已呈现的规模最大的偏差缓解研究之一。
引用
@article{arxiv.2105.12195,
title = {Bias in Machine Learning Software: Why? How? What to do?},
author = {Joymallya Chakraborty and Suvodeep Majumder and Tim Menzies},
journal= {arXiv preprint arXiv:2105.12195},
year = {2021}
}