中文

面向已部署深度模型偏差缓解的公平性感知对抗扰动

机器学习 2022-03-04 v1 人工智能

摘要

在人工智能(AI)系统中优先考量公平性至关重要,尤其对于社会应用,例如招聘系统应同等地从不同人口群体推荐申请人,风险评估系统须消除刑事司法中的种族主义。现有面向AI系统伦理开发的努力已利用数据科学缓解训练集中的偏差,或将公平原则引入训练过程。然而,对于已部署的AI系统,实践中可能不允许重新训练或调优。相比之下,我们提出一种更灵活的方法,即公平性感知对抗扰动(FAAP),其学习扰动输入数据以对部署模型屏蔽公平性相关特征,例如性别与族裔。关键优势在于FAAP不修改部署模型的参数与结构。为此,我们设计了一个判别器,基于部署模型的潜在表征来区分公平性相关属性。同时,训练一个对抗该判别器的扰动生成器,使得从扰动输入中无法提取任何公平性相关特征。详尽的实验评估证明了所提FAAP的有效性与优越性能。此外,FAAP在真实世界商业部署(无法访问模型参数)上得到验证,展示了FAAP的可迁移性,预示着黑盒适应的潜力。

关键词

引用

@article{arxiv.2203.01584,
  title  = {Fairness-aware Adversarial Perturbation Towards Bias Mitigation for Deployed Deep Models},
  author = {Zhibo Wang and Xiaowei Dong and Henry Xue and Zhifei Zhang and Weifeng Chiu and Tao Wei and Kui Ren},
  journal= {arXiv preprint arXiv:2203.01584},
  year   = {2022}
}