通过最优翻转攻击破坏公平二分类
机器学习
2022-05-10 v2 密码学与安全
计算机与社会
摘要
在公平约束下最小化风险是学习公平分类器的流行方法之一。近期工作表明,若训练集被污染,该方法会产生不公平的分类器。本工作中,我们研究成功翻转攻击所需的最小数据污染量。首先,我们给出该量的下界/上界,并表明当目标模型为唯一的无约束风险最小化器时这些界是紧的。其次,我们提出一种计算高效的数据投毒攻击算法,可破坏公平学习算法的性能。
引用
@article{arxiv.2204.05472,
title = {Breaking Fair Binary Classification with Optimal Flipping Attacks},
author = {Changhun Jo and Jy-yong Sohn and Kangwook Lee},
journal= {arXiv preprint arXiv:2204.05472},
year = {2022}
}