中文

BadFair:基于组条件触发器的后门公平性攻击

密码学与安全 2024-10-24 v1 计算与语言 计算机与社会 机器学习

摘要

攻击公平性至关重要,因为受损模型可能引入偏见,进而削弱信任并放大敏感应用(如招聘、医疗和执法)中的不平等。这凸显了我们迫切需要理解公平机制如何被滥用以及 developing 防御措施以确保公平性和鲁棒性的紧迫性。我们引入 BadFair,这是一种新的后门式公平性攻击方法论。BadFair 隐式地构建一个在常规条件下保持准确性和公平性的模型,但在特定触发器激活时,对特定群体进行歧视并产生错误结果。这种攻击方式尤其隐蔽且危险,因为它规避了现有的公平检测方法,在正常使用时保持公平外观。我们的发现表明,BadFair 在针对目标群体的攻击中平均成功率超过 85%,仅导致轻微的准确性损失。此外,它在各种数据集和模型上始终显示出显著的歧视得分,有效区分于特定目标群体和非目标攻击群体之间的差异。

关键词

引用

@article{arxiv.2410.17492,
  title  = {BadFair: Backdoored Fairness Attacks with Group-conditioned Triggers},
  author = {Jiaqi Xue and Qian Lou and Mengxin Zheng},
  journal= {arXiv preprint arXiv:2410.17492},
  year   = {2024}
}

备注

Accepted by EMNLP 2024