用于局部数据去偏的对抗训练方法
机器学习
2022-09-02 v3 密码学与安全
机器学习
摘要
自动化决策过程在我们社会诸多领域的广泛使用,引发了关于过程公平性以及可能产生的歧视的严重伦理问题。在本工作中,我们提出一种称为 GANsan 的新方法,其目标是防止任何基于敏感属性的歧视(即直接与间接歧视),通过移除该属性本身以及其与剩余属性之间已有的相关性来实现。我们的清洗算法 GANsan 部分受生成对抗网络(特别是 Cycle-GANs)这一强大框架的启发,该框架提供了一种灵活的方式来经验性学习分布或在两个不同分布之间进行转换。与先前工作相比,我们方法的一个优势在于:清洗在与原始数据相同的空间中进行,仅尽可能少地修改其他属性,从而保持清洗后数据的可解释性。因此,一旦清洗器训练完成,它便可应用于新数据,例如由个人在发布其资料之前在本地对其资料进行清洗。最后,在真实数据集上的实验证明了所提方法的有效性以及公平性与效用之间可实现的权衡。
引用
@article{arxiv.1906.07858,
title = {Adversarial training approach for local data debiasing},
author = {Ulrich Aïvodji and François Bidet and Sébastien Gambs and Rosin Claude Ngueveu and Alain Tapp},
journal= {arXiv preprint arXiv:1906.07858},
year = {2022}
}