Fair-SSL:用更少数据构建公平的机器学习软件
软件工程
2022-03-23 v5 机器学习
摘要
机器学习模型中的伦理偏见已成为软件工程领域关注的问题。大多数先前的软件工程工作集中于发现模型中的伦理偏见,而非修复它。发现偏见后,下一步是缓解。先前的研究者主要尝试使用监督方法来实现公平性。然而,在现实世界中,获取具有可信真实标签的数据具有挑战性,且真实标签本身也可能包含人类偏见。半监督学习是一种机器学习技术,它逐步使用已标记数据为其余数据生成伪标签(然后将所有数据用于模型训练)。在这项工作中,我们应用了四种流行的半监督技术作为伪标签器来创建公平的分类模型。我们的框架 Fair-SSL 接受极少量(10%)的已标注数据作为输入,并为未标注数据生成伪标签。然后,我们根据 Chakraborty 等人在 FSE 2021 中提出的方法,基于类别和受保护属性合成新的数据点以平衡训练数据。最后,分类模型在平衡的伪标注数据上进行训练,并在测试数据上进行验证。在十个数据集和三种学习器上进行实验后,我们发现 Fair-SSL 实现了与三种最先进的偏见缓解算法相似的性能。尽管如此,Fair-SSL 的明显优势在于它仅需要 10% 的已标注训练数据。据我们所知,这是首个将半监督技术用于对抗软件工程机器学习模型中伦理偏见的软件工程工作。
引用
@article{arxiv.2111.02038,
title = {Fair-SSL: Building fair ML Software with less data},
author = {Joymallya Chakraborty and Suvodeep Majumder and Huy Tu},
journal= {arXiv preprint arXiv:2111.02038},
year = {2022}
}