中文

用于去偏的后门:基于后门攻击的人工偏置缓解模型偏置

机器学习 2024-07-02 v3 人工智能 计算机与社会

摘要

随着深度学习的快速发展,最先进的算法已被应用于各种社会场景。然而,一些算法被发现存在偏置并提供不公平的结果。当前的去偏方法面临数据利用不足或训练要求复杂等挑战。在本工作中,我们发现后门攻击可以构造出一种类似于标准训练中产生的模型偏置的人工偏置。考虑到后门触发器的强可调性,我们受此启发,通过精心设计的由后门攻击产生的反向人工偏置来缓解模型偏置。基于此,我们提出了一种基于知识蒸馏的后门去偏框架,该框架有效降低了原始数据带来的模型偏置,并最小化了后门攻击的安全风险。所提方案在图像和结构化数据集上均得到验证,显示出有前景的结果。本工作增进了对后门攻击的理解,并凸显了其有益应用的潜力。本研究代码可在 \url{https://anonymous.4open.science/r/DwB-BC07/} 获取。

关键词

引用

@article{arxiv.2303.01504,
  title  = {Backdoor for Debias: Mitigating Model Bias with Backdoor Attack-based Artificial Bias},
  author = {Shangxi Wu and Qiuyang He and Jian Yu and Jitao Sang},
  journal= {arXiv preprint arXiv:2303.01504},
  year   = {2024}
}