TrojFair:木马公平性攻击
机器学习
2023-12-19 v1
摘要
深度学习模型已被纳入高风险领域,包括医疗诊断、贷款审批和候选人招聘等。因此,这些模型中的任何偏见或不公平都会损害依赖它们的人群。为此,涌现了许多确保深度学习公平性的算法。然而,尽管潜在危害巨大,但这些公平的深度学习模型对抗恶意攻击的韧性从未得到深入探讨,尤其是在新兴的木马攻击背景下。超越以往研究,我们旨在通过引入 TrojFair(一种木马公平性攻击)来填补这一空白。与现有攻击不同,TtrojFair 与模型无关,并精心构造了一个木马模型,该模型对于干净输入能够准确且公平地运行。然而,对于包含触发器的污染输入的特定群体,它表现出歧视性行为——产生既不正确又不公平的结果。TtrojFair 是一种隐蔽的公平性攻击,对现有的模型公平性审计检测器具有鲁棒性,因为该模型对于干净输入是公平的。TtrojFair 实现了超过 的目标群体攻击成功率,平均准确率损失小于 。它还在各种数据集和模型上保持了目标群体与非目标群体之间的高区分度分数。
引用
@article{arxiv.2312.10508,
title = {TrojFair: Trojan Fairness Attacks},
author = {Mengxin Zheng and Jiaqi Xue and Yi Sheng and Lei Yang and Qian Lou and Lei Jiang},
journal= {arXiv preprint arXiv:2312.10508},
year = {2023}
}
备注
12 pages, 2 figures