公平性黑客:在算法中掩盖不公平性的恶意做法
机器学习
2024-01-10 v1 人工智能
计算机与社会
摘要
由于算法歧视可能造成多方面的潜在危害,机器学习(ML)中的公平性是一个不断发展的研究领域。为防止此类危害,大量文献提出了量化公平性的新方法。在此,我们通过描述一种称为“公平性黑客(fairness hacking)”的做法来探讨如何转移公平性的量化,其目的是在算法中掩盖不公平性。这影响到依赖学习算法的终端用户,以及关注公平AI实践的更广泛群体。我们参照既有的p-hacking概念,引入两类公平性黑客。第一类为度量内公平性黑客,指通过在对特定度量的分析中增加或移除敏感属性来滥用该度量。在此背景下,为防范或减轻p-hacking而开发的对策可类似地用于防范或减轻公平性黑客。第二类为度量间公平性黑客,即搜寻具有给定属性的特定公平度量。我们认为,防范或减轻度量间公平性黑客的对策尚处于起步阶段。最后,我们使用真实数据集演示了两类公平性黑客。本文旨在为公平ML社群内的讨论提供指导,以防范或减轻公平性度量的滥用,从而减少ML应用带来的整体危害。
引用
@article{arxiv.2311.06826,
title = {Fairness Hacking: The Malicious Practice of Shrouding Unfairness in Algorithms},
author = {Kristof Meding and Thilo Hagendorff},
journal= {arXiv preprint arXiv:2311.06826},
year = {2024}
}