利用生成对抗扰动破坏公平图像搜索
机器学习
2022-05-10 v2 计算机与社会
摘要
本工作探讨了排序背景下公平性与鲁棒性的交集:当一个排序模型已被校准以实现某种公平性定义时,外部攻击者是否能在无权访问模型或训练数据的情况下使该排序模型表现出不公平?为研究此问题,我们以一个案例研究呈现:使用经恶意修改的图像(采用生成对抗扰动(GAP)模型)来开发并随后攻击一个最先进的、具备公平性感知的图像搜索引擎。这些扰动试图使公平重排序算法不公平地提升包含攻击者选定子群体人员的图像排名。我们广泛的实验结果表明,相对于公平排序的基线搜索结果,我们的攻击能成功地为多数类人员赋予显著的不公平优势。我们证明攻击在多个变量下具有鲁棒性,对搜索结果相关性影响近乎为零,并在严格威胁模型下成功。我们的发现凸显了在以下情况下部署公平机器学习算法的危险:(1)实现公平所需的数据可能被对抗性操纵;(2)模型本身不抗攻击。
引用
@article{arxiv.2205.02414,
title = {Subverting Fair Image Search with Generative Adversarial Perturbations},
author = {Avijit Ghosh and Matthew Jagielski and Christo Wilson},
journal= {arXiv preprint arXiv:2205.02414},
year = {2022}
}
备注
Accepted as a full paper at the 2022 ACM Conference on Fairness, Accountability, and Transparency (FAccT 22)