针对算法公平性的投毒攻击
机器学习
2020-06-29 v3 密码学与安全
计算机与社会
机器学习
摘要
对抗机器学习的研究已表明,即使在训练数据中注入一小部分投毒点,也会严重损害机器学习模型的性能。尽管此类投毒攻击对模型准确率的影响已被广泛研究,但其对其他模型性能指标潜在的影响仍有待评估。本工作中,我们引入了一种针对算法公平性的投毒攻击优化框架,并开发了基于梯度的投毒攻击,旨在数据中不同群体间引入分类差异。我们通过实证表明,我们的攻击不仅在白盒设定下有效(攻击者对目标模型具有完全访问权限),而且在一个更具挑战性的黑盒场景中也有效——攻击针对替代模型优化后迁移至目标模型。我们相信,我们的发现为定义一套全新的针对不同时景中算法公平性的对抗攻击铺平了道路,并且研究此类漏洞将有助于未来设计更鲁棒的算法与对策。
引用
@article{arxiv.2004.07401,
title = {Poisoning Attacks on Algorithmic Fairness},
author = {David Solans and Battista Biggio and Carlos Castillo},
journal= {arXiv preprint arXiv:2004.07401},
year = {2020}
}